Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Google Research представила ИИ-видеосорежиссёра: 4 агентных фреймворка для создания связных видео длительностью в несколько минут

Google Research представила ИИ-сорежиссёра видео для генерации длинных видеороликов. Набор из 4 агентных фреймворков превращает короткие клипы в связные истории продолжительностью в несколько минут. Он решает проблемы дрейфа идентичности и каскадных ошибок — двух сбоев, которые сегодня нарушают работу большинства конвейеров генерации ИИ-видео из множества кадров.

Почему длинные ИИ-видео распадаются

Диффузионные модели за считанные секунды создают клипы высокого качества. Но объединить эти клипы в историю гораздо сложнее. В большинстве агентных конвейеров модули соединяются с помощью независимых, созданных вручную промптов. Это приводит к семантическому дрейфу, когда одежда или окружение меняются от кадра к кадру. Это также вызывает каскадные сбои, при которых один неудачный исходный ресурс портит все последующие кадры.

Команда Google рассматривает это как проблему распределения заслуг. Если финальное видео получилось испорченным, сложно определить, какой именно промпт стал причиной.

Как работает ИИ-сорежиссёр видео

Система работает поверх Gemini и Veo. Она не зависит от конкретной модели, поэтому тот же слой может управлять и другими генераторами. Результаты наследуют водяные знаки SynthID базовых моделей.

1. Co-Director: творческое планирование как поиск по бандитам

Co-Director, принятый на конференцию COLM 2026, использует многорукого бандита (MAB). Агент-оркестратор выбирает конфигурацию по трём направлениям: творческая стратегия, повествовательный режим и эстетический архетип. Агент предпродакшена создаёт раскадровку. Субагенты ключевых кадров, видео и аудио создают медиаматериалы. Затем судья MLLM оценивает монтаж и отправляет факторизованную награду обратно бандиту.

2. CANVAS: постоянная визуальная память

CANVAS, принятый на конференцию EMNLP 2026, отслеживает персонажей, локации и состояния объектов по мере развития истории. Когда сцена возвращается, система извлекает сохранённые визуальные якоря. В тесте Google с ограблением музея AutoStudio потерял кепку вора, а Gemini-3.1-Pro изменил драгоценный камень. CANVAS сохранил согласованность обоих элементов.

3. A²RD: длинное видео по сегментам

A²RD (Agentic Autoregressive Diffusion) — архитектура, не требующая обучения. Каждый сегмент проходит цикл «извлечение, синтез, уточнение, обновление» с использованием мультимодальной видеопамяти. Агент переключается между экстраполяцией для новых сюжетных элементов и интерполяцией для возвращающихся сущностей. Google представила 10-минутный фильм, созданный таким способом.

4. VQQA: замкнутое уточнение промптов

VQQA (Video Quality Question Answering) генерирует визуальные вопросы для каждого промпта. Критика со стороны VLM выступает в роли «семантических градиентов», переписывающих текстовый промпт. Системе не нужен доступ к внутренним компонентам модели. На этапе глобального отбора выбирается лучшее видео среди всех итераций, а не просто последнее.

Тесты и результаты

Google создала 3 новых теста. GenAD-Bench включает 400 рекламных сценариев для 200 вымышленных продуктов 50 брендов. HardContinuityBench проверяет повторное появление сцен и изменения состояния реквизита. LVBench-C содержит 120 сценариев, в которых ключевые элементы исчезают как минимум на 10 сегментов, прежде чем снова появиться.

  • Co-Director: средний результат 81,4 на GenAD-Bench и 3,96 из 5 по оценкам людей, согласно странице проекта. В число базовых решений вошли Veo 3.1, Kling 3.0 Omni, Wan 2.6 и MovieAgent.
  • CANVAS: прирост на 21,6% по согласованности фона, на 9,6% по согласованности персонажей и на 7,6% по согласованности реквизита.
  • A²RD: до 30% лучшая согласованность и до 20% лучшая связность повествования в видео продолжительностью от 1 до 10 минут.
  • VQQA: абсолютный прирост на 11,57% в T2V-CompBench и на 8,43% в VBench2 по сравнению с обычной генерацией.

Сравнение

ФункцияИИ-сорежиссёр видео GoogleStoryMem (ByteDance, NTU)MovieAgent (Show Lab, NUS)AutoStudio
РезультатМногокадровое видео продолжительностью в несколько минут с закадровым голосом и музыкальным сопровождениемМногокадровое видео продолжительностью около минутыВидео с несколькими сценами и кадрами, субтитрами и аудиоПоследовательности изображений с несколькими итерациями (без видео)
Архитектура4 фреймворка в иерархическом слое оркестрации множества агентовДиффузионная модель Memory-to-Video, кадр за кадромПланирование с рассуждениями по цепочке в системе множества агентов (режиссёр, сценарист, художник раскадровки, менеджер локаций)3 агента на базе LLM и агент на базе Stable Diffusion
Механизм согласованностиПостоянная визуальная память (CANVAS) и мультимодальная видеопамять (A²RD)Банк памяти ключевых кадров из предыдущих сценИерархическое планирование и настройка для каждого персонажаМенеджер объектов и Parallel-UNet
Цикл самокоррекцииПоиск по бандитам с судьёй MLLM; уточнение промптов VQQA с глобальным отборомСемантический отбор ключевых кадров и эстетическая фильтрацияНе сообщаетсяНе сообщается
Обучение моделиБез дообучения; оркестрация существующих моделейДообучение базовой модели с помощью LoRALoRA для каждого персонажа (ED-LoRA через ROICtrl)Без обучения
Базовые генераторыGemini и Veo (не зависит от модели)Wan2.2ROICtrl, SVD, HunyuanVideo I2VStable Diffusion
Максимальная заявленная длительность результата10 минут (A²RD)Около 1 минутыНе указаноН/П (изображения)
КодCo-Director и A²RD доступны публично; CANVAS появится в ближайшее времяПубличныйПубличныйПубличный

Источники: связанные статьи, страницы проектов и репозитории GitHub. Проверено 27 сентября 2026 года.

Основные выводы

  • Google рассматривает длинное видео как задачу глобальной оптимизации и отслеживания состояния мира.
  • 4 фреймворка охватывают планирование, создание раскадровки, генерацию длинных видео и самокоррекцию.
  • Система работает как слой оркестрации поверх Gemini и Veo, используя водяные знаки SynthID.
  • A²RD создал непрерывный 10-минутный фильм со стабильными персонажами и локациями.
  • Co-Director набрал 81,4 балла на GenAD-Bench, опередив базовый результат случайного поиска в 75,7 балла.

Часто задаваемые вопросы

  • Что такое ИИ-сорежиссёр видео Google? Это слой оркестрации множества агентов поверх Gemini и Veo. Он планирует, создаёт и исправляет многокадровые видео, сохраняя их согласованность.
  • Какой длины могут быть видео? A²RD тестировался на видео продолжительностью от 1 до 10 минут, а Google выпустила непрерывный демонстрационный фильм длительностью 10 минут.
  • Могут ли разработчики использовать его уже сегодня? Частично. Код Co-Director и A²RD доступен на GitHub. Код CANVAS пока не опубликован, а полный конвейер не является продуктом Google.

Ознакомьтесь с техническими подробностями. Все права на этот материал принадлежат исследователю проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту по машинному обучению с аудиторией 150 тыс.+ и подписаться на нашу рассылку. Стоп! Вы есть в Telegram? Теперь к нам можно присоединиться и в Telegram.

Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы на Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости