Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

Google Research представила ШІ-відеоспіврежисера: 4 агентні фреймворки для узгодженої генерації відео тривалістю в кілька хвилин

Google Research представила ШІ-співрежисера відео для генерації довгоформатних відео. Цей комплекс із 4 агентних фреймворків перетворює короткі кліпи на зв’язні історії тривалістю кілька хвилин. Він спрямований на вирішення проблеми зміщення ідентичності та каскадних помилок — 2 збоїв, які сьогодні руйнують більшість конвеєрів ШІ для багатокадрового відео.

Чому довгі відео, створені ШІ, розпадаються

Дифузійні моделі рендерять високоякісні кліпи за лічені секунди. Об’єднати ці кліпи в історію складніше. Більшість агентних конвеєрів поєднують модулі з незалежними вручну створеними підказками. Це спричиняє семантичне зміщення, коли одяг або декорації змінюються між кадрами. Це також спричиняє каскадні помилки, коли один несправний вихідний ресурс псує всі наступні кадри.

Команда Google розглядає це як проблему розподілу відповідальності. Відстежити несправне фінальне відео до підказки, яка його спричинила, складно.

Як працює ШІ-співрежисер відео

Система працює поверх Gemini і Veo. Вона не залежить від конкретної моделі, тому той самий рівень може керувати іншими генераторами. Вихідні дані успадковують нанесення водяних знаків SynthID від базових моделей.

1. Co-Director: творче планування як пошук методом бандита

Co-Director, прийнятий до COLM 2026, використовує багаторукого бандита (MAB). Агент-оркестратор обирає конфігурацію з-поміж творчої стратегії, наративного режиму та естетичного архетипу. Агент підготовчого етапу створює розкадрування. Підлеглі агенти ключових кадрів, відео й аудіо генерують медіа. Потім суддя MLLM оцінює монтаж і передає факторизовану винагороду назад бандиту.

2. CANVAS: постійна візуальна пам’ять

CANVAS, прийнятий до EMNLP 2026, відстежує персонажів, локації та стани об’єктів у міру розвитку історії. Коли сцена повертається, він отримує збережені візуальні якорі. У тесті Google із пограбуванням музею AutoStudio втратив кепку злодія, а Gemini-3.1-Pro змінив дорогоцінний камінь. CANVAS зберіг узгодженість обох елементів.

3. A²RD: довге відео сегмент за сегментом

A²RD (агентна авторегресійна дифузія) — це архітектура, яка не потребує навчання. Кожен сегмент проходить цикл «Отримання, синтез, уточнення, оновлення» щодо мультимодальної відеопам’яті. Агент перемикається між екстраполяцією для нових сюжетних моментів та інтерполяцією для персонажів, які повертаються. Google опублікувала 10-хвилинний фільм, згенерований у такий спосіб.

4. VQQA: замкнене уточнення підказок

VQQA (відповіді на запитання про якість відео) генерує візуальні запитання для кожної підказки. Критичні зауваження VLM діють як «семантичні градієнти», що переписують текстову підказку. Системі не потрібен доступ до внутрішніх компонентів моделі. На етапі глобального відбору обирається найкраще відео серед усіх ітерацій, а не просто останнє.

Тести та результати

Google створила 3 нові тести. GenAD-Bench містить 400 рекламних сценаріїв для 200 вигаданих продуктів від 50 брендів. HardContinuityBench перевіряє повторну появу сцен і зміни станів реквізиту. LVBench-C містить 120 сценаріїв, у яких ключові ресурси зникають щонайменше на 10 сегментів, перш ніж повернутися.

  • Co-Director: середній результат 81,4 у GenAD-Bench і 3,96 із 5 за оцінками людей, згідно зі сторінкою проєкту. Серед базових методів були Veo 3.1, Kling 3.0 Omni, Wan 2.6 і MovieAgent.
  • CANVAS: приріст на 21,6% у безперервності фону, на 9,6% у сталості персонажів і на 7,6% у сталості реквізиту.
  • A²RD: до 30% краща узгодженість і до 20% краща наративна цілісність у відео тривалістю від 1 до 10 хвилин.
  • VQQA: абсолютний приріст на 11,57% у T2V-CompBench і на 8,43% у VBench2 порівняно зі звичайною генерацією.

Порівняння

ФункціяШІ-співрежисер відео GoogleStoryMem (ByteDance, NTU)MovieAgent (Show Lab, NUS)AutoStudio
ВихідБагатокадрове відео тривалістю кілька хвилин із закадровим голосом і музичним супроводомБагатокадрове відео тривалістю близько хвилиниБагатосценове, багатокадрове відео із субтитрами й аудіоПослідовності зображень у кілька ітерацій (без відео)
Архітектура4 фреймворки в ієрархічному рівні оркестрації з кількома агентамиДифузійна модель Memory-to-Video, кадр за кадромПланування ланцюжком думок із кількома агентами (режисер, сценарист, художник розкадрування, менеджер локацій)3 агенти LLM плюс агент на основі Stable Diffusion
Механізм узгодженостіПостійна візуальна пам’ять (CANVAS) і мультимодальна відеопам’ять (A²RD)Банк пам’яті ключових кадрів із попередніх кадрівІєрархічне планування плюс налаштування для кожного персонажаМенеджер об’єктів плюс Parallel-UNet
Цикл самокорекціїПошук методом бандита із суддею MLLM; уточнення підказок VQQA з глобальним відборомСемантичний відбір ключових кадрів і естетична фільтраціяНе повідомляєтьсяНе повідомляється
Навчання моделіБез донавчання; оркеструє наявні моделіДонавчання LoRA на базовій моделіLoRA для кожного персонажа (ED-LoRA через ROICtrl)Без навчання
Базові генераториGemini і Veo (не залежить від конкретної моделі)Wan2.2ROICtrl, SVD, HunyuanVideo I2VStable Diffusion
Найдовший заявлений результат10 хвилин (A²RD)Близько 1 хвилиниНе вказаноН/З (зображення)
КодCo-Director і A²RD доступні публічно; CANVAS з’явиться незабаромПублічнийПублічнийПублічний

Джерела: пов’язані статті, сторінки проєктів і репозиторії GitHub. Перевірено 27 вересня 2026 року.

Основні висновки

  • Google розглядає довгоформатне відео як проблему глобальної оптимізації та відстеження стану світу.
  • 4 фреймворки охоплюють планування, розкадрування, довгу генерацію та самокорекцію.
  • Система працює як рівень оркестрації на Gemini і Veo з нанесенням водяних знаків SynthID.
  • A²RD створив безперервний 10-хвилинний фільм зі стабільними персонажами та локаціями.
  • Co-Director набрав 81,4 бала в GenAD-Bench, випередивши базовий показник випадкового пошуку 75,7.

FAQ

  • Що таке ШІ-співрежисер відео Google? Це рівень оркестрації з кількома агентами на Gemini і Veo. Він планує, генерує та виправляє багатокадрові відео, щоб зберігати їхню узгодженість.
  • Якою може бути тривалість відео? A²RD оцінювали на відео тривалістю від 1 до 10 хвилин, а Google випустила безперервний демонстраційний фільм тривалістю 10 хвилин.
  • Чи можуть розробники використовувати це вже сьогодні? Частково. Код Co-Director і A²RD доступний на GitHub. Код CANVAS ще не опубліковано, а повний конвеєр не є продуктом Google.

Перегляньте технічні деталі. Уся подяка належить досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабреддіту про машинне навчання зі 150 тисячами+ учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.

Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки на Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини