Google Research представила ШІ-відеоспіврежисера: 4 агентні фреймворки для узгодженої генерації відео тривалістю в кілька хвилин
Google Research представила ШІ-співрежисера відео для генерації довгоформатних відео. Цей комплекс із 4 агентних фреймворків перетворює короткі кліпи на зв’язні історії тривалістю кілька хвилин. Він спрямований на вирішення проблеми зміщення ідентичності та каскадних помилок — 2 збоїв, які сьогодні руйнують більшість конвеєрів ШІ для багатокадрового відео.
Чому довгі відео, створені ШІ, розпадаються
Дифузійні моделі рендерять високоякісні кліпи за лічені секунди. Об’єднати ці кліпи в історію складніше. Більшість агентних конвеєрів поєднують модулі з незалежними вручну створеними підказками. Це спричиняє семантичне зміщення, коли одяг або декорації змінюються між кадрами. Це також спричиняє каскадні помилки, коли один несправний вихідний ресурс псує всі наступні кадри.
Команда Google розглядає це як проблему розподілу відповідальності. Відстежити несправне фінальне відео до підказки, яка його спричинила, складно.
Як працює ШІ-співрежисер відео
Система працює поверх Gemini і Veo. Вона не залежить від конкретної моделі, тому той самий рівень може керувати іншими генераторами. Вихідні дані успадковують нанесення водяних знаків SynthID від базових моделей.
1. Co-Director: творче планування як пошук методом бандита
Co-Director, прийнятий до COLM 2026, використовує багаторукого бандита (MAB). Агент-оркестратор обирає конфігурацію з-поміж творчої стратегії, наративного режиму та естетичного архетипу. Агент підготовчого етапу створює розкадрування. Підлеглі агенти ключових кадрів, відео й аудіо генерують медіа. Потім суддя MLLM оцінює монтаж і передає факторизовану винагороду назад бандиту.
2. CANVAS: постійна візуальна пам’ять
CANVAS, прийнятий до EMNLP 2026, відстежує персонажів, локації та стани об’єктів у міру розвитку історії. Коли сцена повертається, він отримує збережені візуальні якорі. У тесті Google із пограбуванням музею AutoStudio втратив кепку злодія, а Gemini-3.1-Pro змінив дорогоцінний камінь. CANVAS зберіг узгодженість обох елементів.
3. A²RD: довге відео сегмент за сегментом
A²RD (агентна авторегресійна дифузія) — це архітектура, яка не потребує навчання. Кожен сегмент проходить цикл «Отримання, синтез, уточнення, оновлення» щодо мультимодальної відеопам’яті. Агент перемикається між екстраполяцією для нових сюжетних моментів та інтерполяцією для персонажів, які повертаються. Google опублікувала 10-хвилинний фільм, згенерований у такий спосіб.
4. VQQA: замкнене уточнення підказок
VQQA (відповіді на запитання про якість відео) генерує візуальні запитання для кожної підказки. Критичні зауваження VLM діють як «семантичні градієнти», що переписують текстову підказку. Системі не потрібен доступ до внутрішніх компонентів моделі. На етапі глобального відбору обирається найкраще відео серед усіх ітерацій, а не просто останнє.
Тести та результати
Google створила 3 нові тести. GenAD-Bench містить 400 рекламних сценаріїв для 200 вигаданих продуктів від 50 брендів. HardContinuityBench перевіряє повторну появу сцен і зміни станів реквізиту. LVBench-C містить 120 сценаріїв, у яких ключові ресурси зникають щонайменше на 10 сегментів, перш ніж повернутися.
- Co-Director: середній результат 81,4 у GenAD-Bench і 3,96 із 5 за оцінками людей, згідно зі сторінкою проєкту. Серед базових методів були Veo 3.1, Kling 3.0 Omni, Wan 2.6 і MovieAgent.
- CANVAS: приріст на 21,6% у безперервності фону, на 9,6% у сталості персонажів і на 7,6% у сталості реквізиту.
- A²RD: до 30% краща узгодженість і до 20% краща наративна цілісність у відео тривалістю від 1 до 10 хвилин.
- VQQA: абсолютний приріст на 11,57% у T2V-CompBench і на 8,43% у VBench2 порівняно зі звичайною генерацією.
Порівняння
| Функція | ШІ-співрежисер відео Google | StoryMem (ByteDance, NTU) | MovieAgent (Show Lab, NUS) | AutoStudio |
|---|---|---|---|---|
| Вихід | Багатокадрове відео тривалістю кілька хвилин із закадровим голосом і музичним супроводом | Багатокадрове відео тривалістю близько хвилини | Багатосценове, багатокадрове відео із субтитрами й аудіо | Послідовності зображень у кілька ітерацій (без відео) |
| Архітектура | 4 фреймворки в ієрархічному рівні оркестрації з кількома агентами | Дифузійна модель Memory-to-Video, кадр за кадром | Планування ланцюжком думок із кількома агентами (режисер, сценарист, художник розкадрування, менеджер локацій) | 3 агенти LLM плюс агент на основі Stable Diffusion |
| Механізм узгодженості | Постійна візуальна пам’ять (CANVAS) і мультимодальна відеопам’ять (A²RD) | Банк пам’яті ключових кадрів із попередніх кадрів | Ієрархічне планування плюс налаштування для кожного персонажа | Менеджер об’єктів плюс Parallel-UNet |
| Цикл самокорекції | Пошук методом бандита із суддею MLLM; уточнення підказок VQQA з глобальним відбором | Семантичний відбір ключових кадрів і естетична фільтрація | Не повідомляється | Не повідомляється |
| Навчання моделі | Без донавчання; оркеструє наявні моделі | Донавчання LoRA на базовій моделі | LoRA для кожного персонажа (ED-LoRA через ROICtrl) | Без навчання |
| Базові генератори | Gemini і Veo (не залежить від конкретної моделі) | Wan2.2 | ROICtrl, SVD, HunyuanVideo I2V | Stable Diffusion |
| Найдовший заявлений результат | 10 хвилин (A²RD) | Близько 1 хвилини | Не вказано | Н/З (зображення) |
| Код | Co-Director і A²RD доступні публічно; CANVAS з’явиться незабаром | Публічний | Публічний | Публічний |
Джерела: пов’язані статті, сторінки проєктів і репозиторії GitHub. Перевірено 27 вересня 2026 року.
Основні висновки
- Google розглядає довгоформатне відео як проблему глобальної оптимізації та відстеження стану світу.
- 4 фреймворки охоплюють планування, розкадрування, довгу генерацію та самокорекцію.
- Система працює як рівень оркестрації на Gemini і Veo з нанесенням водяних знаків SynthID.
- A²RD створив безперервний 10-хвилинний фільм зі стабільними персонажами та локаціями.
- Co-Director набрав 81,4 бала в GenAD-Bench, випередивши базовий показник випадкового пошуку 75,7.
FAQ
- Що таке ШІ-співрежисер відео Google? Це рівень оркестрації з кількома агентами на Gemini і Veo. Він планує, генерує та виправляє багатокадрові відео, щоб зберігати їхню узгодженість.
- Якою може бути тривалість відео? A²RD оцінювали на відео тривалістю від 1 до 10 хвилин, а Google випустила безперервний демонстраційний фільм тривалістю 10 хвилин.
- Чи можуть розробники використовувати це вже сьогодні? Частково. Код Co-Director і A²RD доступний на GitHub. Код CANVAS ще не опубліковано, а повний конвеєр не є продуктом Google.
Перегляньте технічні деталі. Уся подяка належить досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабреддіту про машинне навчання зі 150 тисячами+ учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.
Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки на Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.