Дослідники NVIDIA представили Physis-Lang: фізичну мову, що саморозвивається та виводить Cosmos 3 попереду Veo 3.1 у фізичних бенчмарках
Відеомоделі світу можуть створювати переконливі кліпи, які все ж порушують закони фізики. Масло розтікається, наче фарба. М’ячі проходять крізь стіни. Команда з NVIDIA, MIT та Оксфордського університету стверджує, що вирішення проблеми може походити саме з мови, а не з додаткових візуальних, латентних чи числових сигналів.
Їхня система, Physis-Lang, розглядає фізичну мову як спільне оптимізовуване представлення. Один і той самий текст використовується для відбору даних, навчання моделі та інференсу. У відкритому знімку рейтингу Physics-IQ Verified від 29 вересня 2026 року Physis-Lang на Cosmos3-Super посідає перше місце з результатом 48.2 ± 1.4. Версія Cosmos3-Nano посідає друге місце з результатом 43.3 ± 1.5.
Відеомодель світу може створити переконливий кліп і водночас неправильно відтворити фізику.
— NVIDIA AI (@NVIDIAAI) 29 вересня 2026 року
Наші дослідники щойно представили Physis-Lang — відкриту систему, що саморозвивається та додає фізичне міркування до підписів відео. Підписи пояснюють, чому і як розгортається сцена. Ми використовуємо їх для донавчання… pic.twitter.com/agIHuIB6N2
Яку проблему вирішує Physis-Lang?
Звичайні підписи описують те, що відбувається, але не пояснюють чому. «Масло тане, коли температура підвищується» нічого не говорить про передавання тепла чи гравітацію. Physis-Lang додає до кожного базового підпису поле physics_reasoning. У ньому описуються об’єкти, причини, взаємодії, керівні принципи, часова еволюція та наслідки.
Конвеєр також створює специфічний для сцени physics_negative_prompt. Цей текст описує ймовірні неправдоподібні результати, як-от камінь, що плаває на воді. Під час інференсу він діє як негативне обумовлення.
Як працює цикл підписів, що саморозвивається?
У цьому циклі підписувач залишається замороженим, а змінюється лише його інструкція. Підписувач GPT-5.5 створює підписи для фіксованого набору розробки з 20 відео та 273 перевіреними людьми твердженнями. Gemini-3.1-Pro виступає як критик, що враховує фізику. Агент еволюції аналізує оцінки та помилки на рівні тверджень, а потім переписує запит.
Критик оцінює 2 виміри:
- Точність: підпис розділяється на атомарні твердження, і кожне твердження перевіряється за відео.
- Повнота: кожне фізичне твердження, відібране людьми, має бути явно зазначене або випливати з підпису.
Кожен переглянутий запит перевіряється на PhysCapBench — новому бенчмарку з 246 відео та 3 794 перевіреними людьми твердженнями. Показник F1 підписів зріс із 78.64 на першій ітерації до 87.82 на дев’ятій. Шлях не був плавним. На другій ітерації підписи стали надто обережними, і F1 знизився до 76.28. На дев’ятій ітерації вимагалося зазначати кожен видимий причинно-наслідковий крок, а частоту вибірки кадрів було підвищено з 2 до 4 кадрів за секунду.
Як працює добір даних під керуванням мови?
Агент діагностики GPT-5.5 зіставляє помилки згенерованих відео з категоріями фізики, такими як рух твердих тіл, зіткнення та динаміка рідин. Цей профіль недоліків зіставляється з фізичними тегами у великій галереї відео. Пошук орієнтується на фізичний зміст, а не на візуальну схожість.
Фінальний навчальний набір містить 183 тис. відео: 71 тис. відібрано з WISA-80K, а ще 112 тис. — це знайдені кліпи. Сам пошук додав у середньому 3.01 бала за 3 бенчмарками. На VideoPhy-2 хімічні та теплові процеси отримали приріст по 8.00 бала.
Як Physis-Lang порівнюється з Veo 3.1?
Донавчання використовує LoRA для проєкцій уваги без змін архітектури чи цільової функції. Physis-Lang на Cosmos3-Nano порівняно з Veo 3.1 від Google:
- PhyGenBench: 71.04 проти 65.63
- Physics-IQ Verified: 43.41 проти 34.99
- PhyGround: 69.90 проти 69.24
- VideoPhy-2: 68.02 проти 68.87 на повному наборі, 62.36 проти 58.43 на складному піднаборі
Покращення зберігаються для різних базових моделей: +7.05 для Wan2.1-14B, +3.24 для Cosmos3-Edge-4B, +6.22 для Cosmos3-Nano-16B та +5.02 для Cosmos3-Super-64B. Загальна якість залишилася стабільною на VBench-I2V: показник Cosmos3-Nano зріс із 88.32 до 88.69.
Саме введення запитів також допомагає. Фізичне міркування разом із негативними запитами підвищило результат замороженої Cosmos3-Nano на PhyGenBench із 61.67 до 67.29.
Чи може система працювати без комерційних API?
Дослідницька команда дистилювала конвеєр GPT у 2 моделі Qwen3-VL-4B-Instruct: PhysThinker-C для створення підписів і PhysThinker-U для розширення запитів. На Wan2.1-14B комерційний конвеєр забезпечив приріст +7.05 за вартості API близько $24.12K. Заміна його на PhysThinker-C зберегла приріст +6.76 за вартості близько $0.12K. Повністю локальне налаштування коштувало $0 і все одно забезпечило приріст +4.76.
Physis-Lang проти найближчих конкурентів
| Функція | Physis-Lang | PhiZero | PhyGDPO | Self-Refinement |
|---|---|---|---|---|
| Розробник | NVIDIA, MIT, Оксфорд | CASIA (NLPR) | Meta (ECCV 2026) | Liu та ін. |
| Основна ідея | Фізичні підписи природною мовою та негативні запити, що саморозвиваються | Вивчена дискретна «фізична мова», міркування з подальшим рендерингом | Групове DPO з винагородами VLM за фізику | Уточнення мультимодальних запитів у форматі ланцюжка міркувань на основі зворотного зв’язку від VLM |
| Де використовується фізика | Добір даних, навчальні підписи та запити під час інференсу | Модель міркування Qwen3-VL-4B, що подає дані до дифузійного декодера | Навчання вподобань на PhyVidGen-135K | Лише запити під час інференсу |
| Необхідне навчання | LoRA SFT (режим лише із запитами також допомагає) | Так | Так (DPO) | Ні, без навчання |
| Physics-IQ Verified | 43.41 | 40.91 | не вказано | 27.20 |
| PhyGenBench | 71.04 | не вказано | 48.96 | 49.17 |
| VideoPhy-2 (усі / складний) | 68.02 / 62.36 | не вказано | 59.56 / 44.94 | 47.88 / 28.09 |
| PhyGround | 69.90 | 57.85 | не вказано | 58.22 |
| Код / ваги у відкритому доступі | Лише стаття | «Незабаром» | «Буде опубліковано незабаром» | Стаття |
Показники взято зі статті Physis-Lang, таблиці 1–4, і отримано за одним протоколом для кожного бенчмарку (PhyGenBench і VideoPhy-2 використовують оцінювач GPT-5.5). Для показників Physis-Lang використано базову модель Cosmos3-Nano. «Не вказано» означає, що в цьому порівнянні показник не наведено. Статус доступності перевірено 30 вересня 2026 року.
Ключові висновки
- Physis-Lang розвиває фізичні підписи за допомогою агента під керуванням критика, тоді як підписувач залишається замороженим.
- PhysCapBench оцінює підписи за 3 794 перевіреними людьми твердженнями про причини, закони та наслідки.
- Cosmos3-Nano з Physis-Lang перевершує Veo 3.1 у 3 із 4 бенчмарків.
- Самі лише фізичні запити підвищують результат замороженої моделі на 5.62 бала на PhyGenBench.
- Код або ваги поки що не опубліковані; доступна лише стаття.
Ознайомтеся зі статтею, сторінкою проєкту та репозиторієм GitHub. Уся подяка належить досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабреддіту про машинне навчання з понад 150 тис. учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.
Потрібно стати нашим партнером для просування вашого репозиторію GitHub, сторінки Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.