Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

Дослідники NVIDIA представили Physis-Lang: фізичну мову, що саморозвивається та виводить Cosmos 3 попереду Veo 3.1 у фізичних бенчмарках

Відеомоделі світу можуть створювати переконливі кліпи, які все ж порушують закони фізики. Масло розтікається, наче фарба. М’ячі проходять крізь стіни. Команда з NVIDIA, MIT та Оксфордського університету стверджує, що вирішення проблеми може походити саме з мови, а не з додаткових візуальних, латентних чи числових сигналів.

Їхня система, Physis-Lang, розглядає фізичну мову як спільне оптимізовуване представлення. Один і той самий текст використовується для відбору даних, навчання моделі та інференсу. У відкритому знімку рейтингу Physics-IQ Verified від 29 вересня 2026 року Physis-Lang на Cosmos3-Super посідає перше місце з результатом 48.2 ± 1.4. Версія Cosmos3-Nano посідає друге місце з результатом 43.3 ± 1.5.

Відеомодель світу може створити переконливий кліп і водночас неправильно відтворити фізику.

Наші дослідники щойно представили Physis-Lang — відкриту систему, що саморозвивається та додає фізичне міркування до підписів відео. Підписи пояснюють, чому і як розгортається сцена. Ми використовуємо їх для донавчання… pic.twitter.com/agIHuIB6N2

— NVIDIA AI (@NVIDIAAI) 29 вересня 2026 року

Яку проблему вирішує Physis-Lang?

Звичайні підписи описують те, що відбувається, але не пояснюють чому. «Масло тане, коли температура підвищується» нічого не говорить про передавання тепла чи гравітацію. Physis-Lang додає до кожного базового підпису поле physics_reasoning. У ньому описуються об’єкти, причини, взаємодії, керівні принципи, часова еволюція та наслідки.

Конвеєр також створює специфічний для сцени physics_negative_prompt. Цей текст описує ймовірні неправдоподібні результати, як-от камінь, що плаває на воді. Під час інференсу він діє як негативне обумовлення.

Як працює цикл підписів, що саморозвивається?

У цьому циклі підписувач залишається замороженим, а змінюється лише його інструкція. Підписувач GPT-5.5 створює підписи для фіксованого набору розробки з 20 відео та 273 перевіреними людьми твердженнями. Gemini-3.1-Pro виступає як критик, що враховує фізику. Агент еволюції аналізує оцінки та помилки на рівні тверджень, а потім переписує запит.

Критик оцінює 2 виміри:

  • Точність: підпис розділяється на атомарні твердження, і кожне твердження перевіряється за відео.
  • Повнота: кожне фізичне твердження, відібране людьми, має бути явно зазначене або випливати з підпису.

Кожен переглянутий запит перевіряється на PhysCapBench — новому бенчмарку з 246 відео та 3 794 перевіреними людьми твердженнями. Показник F1 підписів зріс із 78.64 на першій ітерації до 87.82 на дев’ятій. Шлях не був плавним. На другій ітерації підписи стали надто обережними, і F1 знизився до 76.28. На дев’ятій ітерації вимагалося зазначати кожен видимий причинно-наслідковий крок, а частоту вибірки кадрів було підвищено з 2 до 4 кадрів за секунду.

Як працює добір даних під керуванням мови?

Агент діагностики GPT-5.5 зіставляє помилки згенерованих відео з категоріями фізики, такими як рух твердих тіл, зіткнення та динаміка рідин. Цей профіль недоліків зіставляється з фізичними тегами у великій галереї відео. Пошук орієнтується на фізичний зміст, а не на візуальну схожість.

Фінальний навчальний набір містить 183 тис. відео: 71 тис. відібрано з WISA-80K, а ще 112 тис. — це знайдені кліпи. Сам пошук додав у середньому 3.01 бала за 3 бенчмарками. На VideoPhy-2 хімічні та теплові процеси отримали приріст по 8.00 бала.

Як Physis-Lang порівнюється з Veo 3.1?

Донавчання використовує LoRA для проєкцій уваги без змін архітектури чи цільової функції. Physis-Lang на Cosmos3-Nano порівняно з Veo 3.1 від Google:

  • PhyGenBench: 71.04 проти 65.63
  • Physics-IQ Verified: 43.41 проти 34.99
  • PhyGround: 69.90 проти 69.24
  • VideoPhy-2: 68.02 проти 68.87 на повному наборі, 62.36 проти 58.43 на складному піднаборі

Покращення зберігаються для різних базових моделей: +7.05 для Wan2.1-14B, +3.24 для Cosmos3-Edge-4B, +6.22 для Cosmos3-Nano-16B та +5.02 для Cosmos3-Super-64B. Загальна якість залишилася стабільною на VBench-I2V: показник Cosmos3-Nano зріс із 88.32 до 88.69.

Саме введення запитів також допомагає. Фізичне міркування разом із негативними запитами підвищило результат замороженої Cosmos3-Nano на PhyGenBench із 61.67 до 67.29.

Чи може система працювати без комерційних API?

Дослідницька команда дистилювала конвеєр GPT у 2 моделі Qwen3-VL-4B-Instruct: PhysThinker-C для створення підписів і PhysThinker-U для розширення запитів. На Wan2.1-14B комерційний конвеєр забезпечив приріст +7.05 за вартості API близько $24.12K. Заміна його на PhysThinker-C зберегла приріст +6.76 за вартості близько $0.12K. Повністю локальне налаштування коштувало $0 і все одно забезпечило приріст +4.76.

Physis-Lang проти найближчих конкурентів

ФункціяPhysis-LangPhiZeroPhyGDPOSelf-Refinement
РозробникNVIDIA, MIT, ОксфордCASIA (NLPR)Meta (ECCV 2026)Liu та ін.
Основна ідеяФізичні підписи природною мовою та негативні запити, що саморозвиваютьсяВивчена дискретна «фізична мова», міркування з подальшим рендерингомГрупове DPO з винагородами VLM за фізикуУточнення мультимодальних запитів у форматі ланцюжка міркувань на основі зворотного зв’язку від VLM
Де використовується фізикаДобір даних, навчальні підписи та запити під час інференсуМодель міркування Qwen3-VL-4B, що подає дані до дифузійного декодераНавчання вподобань на PhyVidGen-135KЛише запити під час інференсу
Необхідне навчанняLoRA SFT (режим лише із запитами також допомагає)ТакТак (DPO)Ні, без навчання
Physics-IQ Verified43.4140.91не вказано27.20
PhyGenBench71.04не вказано48.9649.17
VideoPhy-2 (усі / складний)68.02 / 62.36не вказано59.56 / 44.9447.88 / 28.09
PhyGround69.9057.85не вказано58.22
Код / ваги у відкритому доступіЛише стаття«Незабаром»«Буде опубліковано незабаром»Стаття

Показники взято зі статті Physis-Lang, таблиці 1–4, і отримано за одним протоколом для кожного бенчмарку (PhyGenBench і VideoPhy-2 використовують оцінювач GPT-5.5). Для показників Physis-Lang використано базову модель Cosmos3-Nano. «Не вказано» означає, що в цьому порівнянні показник не наведено. Статус доступності перевірено 30 вересня 2026 року.

Ключові висновки

  • Physis-Lang розвиває фізичні підписи за допомогою агента під керуванням критика, тоді як підписувач залишається замороженим.
  • PhysCapBench оцінює підписи за 3 794 перевіреними людьми твердженнями про причини, закони та наслідки.
  • Cosmos3-Nano з Physis-Lang перевершує Veo 3.1 у 3 із 4 бенчмарків.
  • Самі лише фізичні запити підвищують результат замороженої моделі на 5.62 бала на PhyGenBench.
  • Код або ваги поки що не опубліковані; доступна лише стаття.

Ознайомтеся зі статтею, сторінкою проєкту та репозиторієм GitHub. Уся подяка належить досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабреддіту про машинне навчання з понад 150 тис. учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.

Потрібно стати нашим партнером для просування вашого репозиторію GitHub, сторінки Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини