Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Исследователи NVIDIA представили Physis-Lang: саморазвивающийся физический язык, который позволяет Cosmos 3 обойти Veo 3.1 в физических бенчмарках

Модели мира для видео могут создавать убедительные ролики, которые при этом нарушают законы физики. Масло намазывается как краска. Мячи проходят сквозь стены. Команда из NVIDIA, MIT и Оксфордского университета утверждает, что решение может быть найдено в самом языке, а не в дополнительных визуальных, латентных или числовых сигналах.

Их фреймворк Physis-Lang рассматривает физический язык как общее оптимизируемое представление. Один и тот же текст используется для отбора данных, обучения модели и вывода. Согласно снимку общедоступного рейтинга Physics-IQ Verified от 29 сентября 2026 года, Physis-Lang на Cosmos3-Super занимает первое место с результатом 48,2 ± 1,4. Версия Cosmos3-Nano занимает второе место с результатом 43,3 ± 1,5.

Модель мира для видео может создать убедительный ролик и при этом ошибиться в физике.

Наши исследователи только что представили Physis-Lang — открытый саморазвивающийся фреймворк, который добавляет физическое рассуждение к подписям к видео. Подписи объясняют, почему и как развивается сцена. Мы используем их для дообучения… pic.twitter.com/agIHuIB6N2

— NVIDIA AI (@NVIDIAAI) 29 сентября 2026 года

Какую проблему решает Physis-Lang?

Обычные подписи описывают, что происходит, но не объясняют почему. «Масло тает при повышении температуры» ничего не говорит о передаче тепла или гравитации. Physis-Lang добавляет поле physics_reasoning к каждой базовой подписи. В нём подробно описываются сущности, причины, взаимодействия, управляющие принципы, временная динамика и эффекты.

В рамках этого процесса также создаётся зависящий от сцены physics_negative_prompt. Этот текст описывает вероятные неправдоподобные исходы, например камень, плавающий на воде. Во время вывода он выступает в качестве негативного условия.

Как работает цикл саморазвивающихся подписей?

В рамках цикла модель, создающая подписи, остаётся замороженной, а развивается только её инструкция. Модель GPT-5.5 создаёт подписи для фиксированного набора из 20 видео с 273 проверенными людьми утверждениями. Gemini-3.1-Pro выступает в роли критика, учитывающего физику. Агент эволюции анализирует оценки и ошибки на уровне утверждений, после чего переписывает запрос.

Критик оценивает 2 измерения:

  • Точность: подпись разделяется на атомарные утверждения, и каждое утверждение проверяется по видео.
  • Полнота: каждое физическое утверждение, отобранное людьми, должно быть явно указано в подписи или логически следовать из неё.

Каждый изменённый запрос проверяется на PhysCapBench — новом бенчмарке из 246 видео и 3 794 проверенных людьми утверждений. Показатель F1 для подписей вырос с 78,64 на первой итерации до 87,82 на девятой. Путь не был гладким. На второй итерации подписи стали чрезмерно осторожными, и показатель F1 упал до 76,28. На девятой итерации потребовалось указывать каждый видимый причинно-следственный шаг, а частота выборки кадров была увеличена с 2 до 4 кадров в секунду.

Как работает отбор данных под управлением языка?

Диагностический агент GPT-5.5 сопоставляет ошибки сгенерированных видео с такими категориями физики, как движение твёрдых тел, столкновения и гидродинамика. Этот профиль недостатков сопоставляется с физическими тегами в большой галерее видео. При поиске учитывается физическое содержание, а не визуальное сходство.

Итоговый обучающий набор содержит 183 тыс. видео: 71 тыс. отфильтрованы из WISA-80K, ещё 112 тыс. роликов были извлечены поиском. Один только поиск добавил в среднем 3,01 балла по 3 бенчмаркам. В VideoPhy-2 химические и тепловые процессы прибавили по 8,00 балла.

Как Physis-Lang сравнивается с Veo 3.1?

Дообучение выполняется с помощью LoRA на проекциях внимания, без изменений архитектуры или целевой функции. Physis-Lang на Cosmos3-Nano в сравнении с Veo 3.1 от Google:

  • PhyGenBench: 71,04 против 65,63
  • Physics-IQ Verified: 43,41 против 34,99
  • PhyGround: 69,90 против 69,24
  • VideoPhy-2: 68,02 против 68,87 на полном наборе, 62,36 против 58,43 на сложной выборке

Прирост сохраняется на разных базовых моделях: +7,05 для Wan2.1-14B, +3,24 для Cosmos3-Edge-4B, +6,22 для Cosmos3-Nano-16B и +5,02 для Cosmos3-Super-64B. Общее качество сохранилось на прежнем уровне в VBench-I2V: показатель Cosmos3-Nano вырос с 88,32 до 88,69.

Одни только запросы также помогают. Физическое рассуждение вместе с негативными запросами повысило результат замороженной Cosmos3-Nano на PhyGenBench с 61,67 до 67,29.

Можно ли запускать систему без коммерческих API?

Исследовательская команда дистиллировала конвейер GPT в 2 модели Qwen3-VL-4B-Instruct: PhysThinker-C для создания подписей и PhysThinker-U для увеличения запросов. На Wan2.1-14B коммерческий конвейер дал прирост +7,05 при стоимости API около 24,12 тыс. долларов. Замена его на PhysThinker-C сохранила прирост +6,76 при стоимости около 0,12 тыс. долларов. Полностью локальная конфигурация стоила 0 долларов и всё же добавила +4,76.

Physis-Lang в сравнении с ближайшими конкурентами

ФункцияPhysis-LangPhiZeroPhyGDPOSelf-Refinement
РазработчикNVIDIA, MIT, OxfordCASIA (NLPR)Meta (ECCV 2026)Liu et al.
Основная идеяСаморазвивающиеся физические подписи на естественном языке и негативные запросыИзученный дискретный «физический язык», рассуждение с последующим рендерингомГрупповой DPO с физическими оценками от VLMУточнение мультимодальных запросов с пошаговым рассуждением на основе обратной связи VLM
Где используется физикаОтбор данных, подписи при обучении и запросы при выводеМодель рассуждений Qwen3-VL-4B, передающая данные декодеру диффузииОбучение предпочтениям на PhyVidGen-135KТолько запросы при выводе
Требуется обучениеLoRA SFT (режим только с запросами также помогает)ДаДа (DPO)Нет, без обучения
Physics-IQ Verified43,4140,91н/д27,20
PhyGenBench71,04н/д48,9649,17
VideoPhy-2 (все / сложная выборка)68,02 / 62,36н/д59,56 / 44,9447,88 / 28,09
PhyGround69,9057,85н/д58,22
Код / веса доступны публичноТолько статья«Скоро»«Скоро будет выпущено»Статья

Оценки взяты из статьи Physis-Lang, таблицы с 1 по 4, и получены по одному протоколу для каждого бенчмарка (в PhyGenBench и VideoPhy-2 используется оценщик GPT-5.5). Для чисел Physis-Lang использовалась базовая модель Cosmos3-Nano. н/д = не указано в этом сравнении. Статус релиза проверен 30 сентября 2026 года.

Ключевые выводы

  • Physis-Lang развивает физические подписи с помощью агента под управлением критика, пока модель создания подписей остаётся замороженной.
  • PhysCapBench оценивает подписи по 3 794 проверенным людьми утверждениям о причинах, законах и эффектах.
  • Cosmos3-Nano с Physis-Lang превосходит Veo 3.1 в 3 из 4 бенчмарков.
  • Одни только физические запросы повышают результат замороженной модели на 5,62 балла в PhyGenBench.
  • Код или веса пока не опубликованы; выпущена только статья.

Ознакомьтесь со статьёй, страницей проекта и репозиторием на GitHub. Все заслуги принадлежат исследователям этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? Теперь к нам можно присоединиться и в Telegram.

Хотите стать нашим партнёром для продвижения вашего репозитория на GitHub, страницы на Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости