Исследователи NVIDIA представили Physis-Lang: саморазвивающийся физический язык, который позволяет Cosmos 3 обойти Veo 3.1 в физических бенчмарках
Модели мира для видео могут создавать убедительные ролики, которые при этом нарушают законы физики. Масло намазывается как краска. Мячи проходят сквозь стены. Команда из NVIDIA, MIT и Оксфордского университета утверждает, что решение может быть найдено в самом языке, а не в дополнительных визуальных, латентных или числовых сигналах.
Их фреймворк Physis-Lang рассматривает физический язык как общее оптимизируемое представление. Один и тот же текст используется для отбора данных, обучения модели и вывода. Согласно снимку общедоступного рейтинга Physics-IQ Verified от 29 сентября 2026 года, Physis-Lang на Cosmos3-Super занимает первое место с результатом 48,2 ± 1,4. Версия Cosmos3-Nano занимает второе место с результатом 43,3 ± 1,5.
Модель мира для видео может создать убедительный ролик и при этом ошибиться в физике.
— NVIDIA AI (@NVIDIAAI) 29 сентября 2026 года
Наши исследователи только что представили Physis-Lang — открытый саморазвивающийся фреймворк, который добавляет физическое рассуждение к подписям к видео. Подписи объясняют, почему и как развивается сцена. Мы используем их для дообучения… pic.twitter.com/agIHuIB6N2
Какую проблему решает Physis-Lang?
Обычные подписи описывают, что происходит, но не объясняют почему. «Масло тает при повышении температуры» ничего не говорит о передаче тепла или гравитации. Physis-Lang добавляет поле physics_reasoning к каждой базовой подписи. В нём подробно описываются сущности, причины, взаимодействия, управляющие принципы, временная динамика и эффекты.
В рамках этого процесса также создаётся зависящий от сцены physics_negative_prompt. Этот текст описывает вероятные неправдоподобные исходы, например камень, плавающий на воде. Во время вывода он выступает в качестве негативного условия.
Как работает цикл саморазвивающихся подписей?
В рамках цикла модель, создающая подписи, остаётся замороженной, а развивается только её инструкция. Модель GPT-5.5 создаёт подписи для фиксированного набора из 20 видео с 273 проверенными людьми утверждениями. Gemini-3.1-Pro выступает в роли критика, учитывающего физику. Агент эволюции анализирует оценки и ошибки на уровне утверждений, после чего переписывает запрос.
Критик оценивает 2 измерения:
- Точность: подпись разделяется на атомарные утверждения, и каждое утверждение проверяется по видео.
- Полнота: каждое физическое утверждение, отобранное людьми, должно быть явно указано в подписи или логически следовать из неё.
Каждый изменённый запрос проверяется на PhysCapBench — новом бенчмарке из 246 видео и 3 794 проверенных людьми утверждений. Показатель F1 для подписей вырос с 78,64 на первой итерации до 87,82 на девятой. Путь не был гладким. На второй итерации подписи стали чрезмерно осторожными, и показатель F1 упал до 76,28. На девятой итерации потребовалось указывать каждый видимый причинно-следственный шаг, а частота выборки кадров была увеличена с 2 до 4 кадров в секунду.
Как работает отбор данных под управлением языка?
Диагностический агент GPT-5.5 сопоставляет ошибки сгенерированных видео с такими категориями физики, как движение твёрдых тел, столкновения и гидродинамика. Этот профиль недостатков сопоставляется с физическими тегами в большой галерее видео. При поиске учитывается физическое содержание, а не визуальное сходство.
Итоговый обучающий набор содержит 183 тыс. видео: 71 тыс. отфильтрованы из WISA-80K, ещё 112 тыс. роликов были извлечены поиском. Один только поиск добавил в среднем 3,01 балла по 3 бенчмаркам. В VideoPhy-2 химические и тепловые процессы прибавили по 8,00 балла.
Как Physis-Lang сравнивается с Veo 3.1?
Дообучение выполняется с помощью LoRA на проекциях внимания, без изменений архитектуры или целевой функции. Physis-Lang на Cosmos3-Nano в сравнении с Veo 3.1 от Google:
- PhyGenBench: 71,04 против 65,63
- Physics-IQ Verified: 43,41 против 34,99
- PhyGround: 69,90 против 69,24
- VideoPhy-2: 68,02 против 68,87 на полном наборе, 62,36 против 58,43 на сложной выборке
Прирост сохраняется на разных базовых моделях: +7,05 для Wan2.1-14B, +3,24 для Cosmos3-Edge-4B, +6,22 для Cosmos3-Nano-16B и +5,02 для Cosmos3-Super-64B. Общее качество сохранилось на прежнем уровне в VBench-I2V: показатель Cosmos3-Nano вырос с 88,32 до 88,69.
Одни только запросы также помогают. Физическое рассуждение вместе с негативными запросами повысило результат замороженной Cosmos3-Nano на PhyGenBench с 61,67 до 67,29.
Можно ли запускать систему без коммерческих API?
Исследовательская команда дистиллировала конвейер GPT в 2 модели Qwen3-VL-4B-Instruct: PhysThinker-C для создания подписей и PhysThinker-U для увеличения запросов. На Wan2.1-14B коммерческий конвейер дал прирост +7,05 при стоимости API около 24,12 тыс. долларов. Замена его на PhysThinker-C сохранила прирост +6,76 при стоимости около 0,12 тыс. долларов. Полностью локальная конфигурация стоила 0 долларов и всё же добавила +4,76.
Physis-Lang в сравнении с ближайшими конкурентами
| Функция | Physis-Lang | PhiZero | PhyGDPO | Self-Refinement |
|---|---|---|---|---|
| Разработчик | NVIDIA, MIT, Oxford | CASIA (NLPR) | Meta (ECCV 2026) | Liu et al. |
| Основная идея | Саморазвивающиеся физические подписи на естественном языке и негативные запросы | Изученный дискретный «физический язык», рассуждение с последующим рендерингом | Групповой DPO с физическими оценками от VLM | Уточнение мультимодальных запросов с пошаговым рассуждением на основе обратной связи VLM |
| Где используется физика | Отбор данных, подписи при обучении и запросы при выводе | Модель рассуждений Qwen3-VL-4B, передающая данные декодеру диффузии | Обучение предпочтениям на PhyVidGen-135K | Только запросы при выводе |
| Требуется обучение | LoRA SFT (режим только с запросами также помогает) | Да | Да (DPO) | Нет, без обучения |
| Physics-IQ Verified | 43,41 | 40,91 | н/д | 27,20 |
| PhyGenBench | 71,04 | н/д | 48,96 | 49,17 |
| VideoPhy-2 (все / сложная выборка) | 68,02 / 62,36 | н/д | 59,56 / 44,94 | 47,88 / 28,09 |
| PhyGround | 69,90 | 57,85 | н/д | 58,22 |
| Код / веса доступны публично | Только статья | «Скоро» | «Скоро будет выпущено» | Статья |
Оценки взяты из статьи Physis-Lang, таблицы с 1 по 4, и получены по одному протоколу для каждого бенчмарка (в PhyGenBench и VideoPhy-2 используется оценщик GPT-5.5). Для чисел Physis-Lang использовалась базовая модель Cosmos3-Nano. н/д = не указано в этом сравнении. Статус релиза проверен 30 сентября 2026 года.
Ключевые выводы
- Physis-Lang развивает физические подписи с помощью агента под управлением критика, пока модель создания подписей остаётся замороженной.
- PhysCapBench оценивает подписи по 3 794 проверенным людьми утверждениям о причинах, законах и эффектах.
- Cosmos3-Nano с Physis-Lang превосходит Veo 3.1 в 3 из 4 бенчмарков.
- Одни только физические запросы повышают результат замороженной модели на 5,62 балла в PhyGenBench.
- Код или веса пока не опубликованы; выпущена только статья.
Ознакомьтесь со статьёй, страницей проекта и репозиторием на GitHub. Все заслуги принадлежат исследователям этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? Теперь к нам можно присоединиться и в Telegram.
Хотите стать нашим партнёром для продвижения вашего репозитория на GitHub, страницы на Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.