Google Research представи ИИ-видеосорежисьор: 4 агентни рамки за съгласувано генериране на видеа с дължина от няколко минути
Google Research представи AI видеосърежисьор за генериране на дългоформатни видеа. Комплектът от 4 агентни рамки превръща кратки клипове в свързани истории с продължителност от няколко минути. Той адресира разминаването в идентичността и каскадните грешки — двата проблема, които днес провалят повечето AI конвейери за видео с множество кадри.
Защо дългите AI видеа се разпадат
Дифузионните модели създават висококачествени клипове за секунди. Обединяването на тези клипове в история е по-трудно. Повечето агентни конвейери свързват модули с независими, ръчно създадени подсказки. Това води до семантично отклонение, при което облеклото или пейзажът се променят между кадрите. То води и до каскадни грешки, при които един дефектен актив от по-ранен етап поврежда всеки следващ кадър.
Екипът на Google представя това като проблем с разпределянето на заслугата. Трудно е да се проследи повредено финално видео обратно до подсказката, която го е причинила.
Как работи AI видеосърежисьорът
Системата работи върху Gemini и Veo. Тя е независима от конкретния модел, така че същият слой може да управлява и други генератори. Резултатите наследяват водните знаци SynthID от базовите модели.
1. Co-Director: творческо планиране като търсене с бандит
Co-Director, приет на COLM 2026, използва многорък бандит (MAB). Оркестраторът избира конфигурация между творческа стратегия, наративен режим и естетически архетип. Агентът за предпроизводство изгражда сториборда. Подагентите за ключови кадри, видео и аудио създават медийното съдържание. След това съдията MLLM оценява монтажа и изпраща факторизирана награда обратно към бандита.
2. CANVAS: постоянна визуална памет
CANVAS, приет на EMNLP 2026, проследява персонажите, местоположенията и състоянията на обектите с развитието на историята. Той извлича съхранени визуални ориентири, когато дадена сцена се появи отново. В музейния тест на Google за обир AutoStudio изгуби шапката на крадеца, а Gemini-3.1-Pro промени скъпоценния камък. CANVAS запази и двете последователни.
3. A²RD: дълго видео сегмент по сегмент
A²RD (Agentic Autoregressive Diffusion) е архитектура без обучение. Всеки сегмент преминава през цикъл „Извличане, Синтезиране, Усъвършенстване, Актуализиране“ спрямо мултимодална видео памет. Агентът превключва между екстраполация за нови сюжетни моменти и интерполация за завръщащи се обекти. Google сподели 10-минутен филм, генериран по този начин.
4. VQQA: итеративно усъвършенстване на подсказките
VQQA (Video Quality Question Answering) генерира визуални въпроси за всяка подсказка. Критиките от VLM действат като „семантични градиенти“, които пренаписват текстовата подсказка. Той не се нуждае от достъп до вътрешните механизми на модела. Стъпката за глобален подбор избира най-доброто видео измежду всички итерации, а не просто последното.
Бенчмаркове и резултати
Google създаде 3 нови бенчмарка. GenAD-Bench съдържа 400 рекламни сценария за 200 измислени продукта от 50 марки. HardContinuityBench подлага на изпитание повторното появяване на сцени и промените в състоянието на реквизита. LVBench-C съдържа 120 сценария, в които ключови активи изчезват за поне 10 сегмента, преди да се завърнат.
- Co-Director: среден резултат 81.4 в GenAD-Bench и 3.96 от 5 при човешките оценки според страницата на проекта. Базовите модели включват Veo 3.1, Kling 3.0 Omni, Wan 2.6 и MovieAgent.
- CANVAS: подобрения от 21.6% в последователността на фона, 9.6% в съгласуваността на персонажите и 7.6% в последователността на реквизита.
- A²RD: до 30% по-добра съгласуваност и 20% по-добра наративна последователност при видеа с продължителност от 1 до 10 минути.
- VQQA: абсолютни подобрения от 11.57% в T2V-CompBench и 8.43% в VBench2 спрямо стандартното генериране.
Как се сравнява
| Функция | Google AI Video Co-Director | StoryMem (ByteDance, NTU) | MovieAgent (Show Lab, NUS) | AutoStudio |
|---|---|---|---|---|
| Резултат | Видео с множество кадри и продължителност от няколко минути, с озвучаване и музика | Видео с множество кадри и продължителност около една минута | Видео с множество сцени и кадри, със субтитри и аудио | Последователности от изображения с множество итерации (без видео) |
| Архитектура | 4 рамки в йерархичен слой за оркестрация на множество агенти | Дифузионен модел Memory-to-Video, кадър по кадър | Планиране с верига от мисли и множество агенти (режисьор, сценарист, художник на сториборд, мениджър на локации) | 3 LLM агента плюс агент, базиран на Stable Diffusion |
| Механизъм за последователност | Постоянна визуална памет (CANVAS) и мултимодална видео памет (A²RD) | Банка с памет за ключови кадри от по-ранни сцени | Йерархично планиране плюс персонализация за всеки персонаж | Мениджър на обектите плюс Parallel-UNet |
| Цикъл на самокорекция | Търсене с бандит със съдия MLLM; усъвършенстване на подсказките с VQQA и глобален подбор | Семантичен подбор на ключови кадри и естетическо филтриране | Не е посочено | Не е посочено |
| Обучение на модела | Без дообучаване; оркестрира съществуващи модели | Дообучаване с LoRA на базовия модел | LoRA за всеки персонаж (ED-LoRA чрез ROICtrl) | Без обучение |
| Базови генератори | Gemini и Veo (независим от модела) | Wan2.2 | ROICtrl, SVD, HunyuanVideo I2V | Stable Diffusion |
| Най-дълъг отчетен резултат | 10 минути (A²RD) | Около 1 минута | Не е посочено | Неприложимо (изображения) |
| Код | Co-Director и A²RD са публични; CANVAS предстои | Публичен | Публичен | Публичен |
Източници: свързаните научни статии, страници на проектите и GitHub хранилища. Проверено на 27 септември 2026 г.
Основни изводи
- Google разглежда дългоформатното видео като проблем за глобална оптимизация и проследяване на състоянието на света.
- 4 рамки обхващат планирането, създаването на сториборд, дългото генериране и самокорекцията.
- Системата работи като оркестрационен слой върху Gemini и Veo, с водни знаци SynthID.
- A²RD създаде непрекъснат 10-минутен филм със стабилни персонажи и локации.
- Co-Director постигна 81.4 в GenAD-Bench, изпреварвайки базовия резултат от 75.7 при случайно търсене.
Често задавани въпроси
- Какво представлява AI видеосърежисьорът на Google? Това е слой за оркестрация на множество агенти върху Gemini и Veo. Той планира, генерира и коригира видеа с множество кадри, за да ги запази последователни.
- Колко дълги могат да бъдат видеата? A²RD е оценен върху видеа с продължителност от 1 до 10 минути, а Google публикува непрекъснат демонстрационен филм с продължителност 10 минути.
- Могат ли разработчиците да го използват днес? Частично. Кодът на Co-Director и A²RD е в GitHub. Кодът на CANVAS предстои да бъде публикуван, а целият конвейер не е продукт на Google.
Вижте техническите подробности. Всички заслуги са на изследователя на този проект. Също така, не се колебайте да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.
Искате да си партнирате с нас за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face ИЛИ продуктово представяне ИЛИ уебинар и т.н.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.