Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

Изследователи от NVIDIA представиха Physis-Lang: саморазвиващ се физически език, който поставя Cosmos 3 пред Veo 3.1 в тестове за физика

Видео моделите на света могат да рендерират убедителни клипове, които въпреки това нарушават физиката. Маслото се разнася като боя. Топките преминават през стени. Екип от NVIDIA, MIT и Оксфордския университет твърди, че решението може да дойде от самия език, а не от допълнителни визуални, латентни или числови сигнали.

Тяхната рамка, Physis-Lang, разглежда езика на физиката като споделено, оптимизируемо представяне. Един и същ текст управлява селекцията на данни, обучението на модела и извеждането. В публичната моментна снимка на класацията Physics-IQ Verified от 29 септември 2026 г. Physis-Lang върху Cosmos3-Super заема първо място с 48.2 ± 1.4. Версията Cosmos3-Nano е на второ място с 43.3 ± 1.5.

Моделът на света във видео може да създаде убедителен клип и въпреки това да представи физиката неправилно.

Нашите изследователи току-що представиха Physis-Lang — отворена саморазвиваща се рамка, която добавя физическо разсъждение към описанията на видеа. Описанията обясняват защо и как се развива дадена сцена. Използваме ги, за да дообучаваме… pic.twitter.com/agIHuIB6N2

— NVIDIA AI (@NVIDIAAI) 29 септември 2026 г.

Какъв проблем решава Physis-Lang?

Конвенционалните описания посочват какво се случва, но не и защо. „Маслото се топи с повишаването на температурата“ не казва нищо за преноса на топлина или гравитацията. Physis-Lang добавя поле physics_reasoning към всяко базово описание. То описва обектите, причините, взаимодействията, управляващите принципи, времевото развитие и ефектите.

Конвейерът също така създава специфичен за сцената physics_negative_prompt. Този текст описва вероятни неправдоподобни резултати, като например камък, носещ се по водата. Той служи като отрицателно кондициониране по време на извеждането.

Как работи саморазвиващият се цикъл на описанията?

Цикълът запазва модела за създаване на описания замразен и развива единствено инструкциите му. Модел за създаване на описания GPT-5.5 пише описания за фиксиран набор от 20 видеа за разработка с 273 проверени от хора твърдения. Gemini-3.1-Pro действа като критик, съобразен с физиката. Агент за развитие прочита оценките и неуспехите на ниво твърдение, след което пренаписва подканата.

Критикът оценява 2 измерения:

  • Прецизност: описанието се разделя на атомарни твърдения и всяко твърдение се проверява спрямо видеото.
  • Пълнота: всяко физическо твърдение, подбрано от хора, трябва да бъде изрично посочено или да следва от описанието.

Всяка преработена подкана се валидира върху PhysCapBench — нов бенчмарк от 246 видеа и 3 794 проверени от хора твърдения. F1 оценката на описанията се повишава от 78.64 при итерация 1 до 87.82 при итерация 9. Пътят не е гладък. При итерация 2 описанията стават прекалено предпазливи и F1 спада до 76.28. Итерация 9 изисква всяка видима причинно-следствена стъпка и увеличава честотата на семплиране на кадри от 2 fps на 4 fps.

Как работи селекцията на данни, насочвана от езика?

Диагностичен агент GPT-5.5 съпоставя грешките на генерираните видеа с категории от физиката като движение на твърди тела, сблъсъци и флуидна динамика. Този профил на недостатъците се съпоставя с физични тагове в голяма галерия от видеа. Извличането е насочено към физическото съдържание, а не към визуалния вид.

Крайният набор за обучение съдържа 183K видеа: 71K филтрирани от WISA-80K плюс 112K извлечени клипа. Самото извличане добавя средно 3.01 точки в 3 бенчмарка. При VideoPhy-2 химичните и термичните процеси печелят по 8.00 точки.

Как се сравнява Physis-Lang с Veo 3.1?

Дообучаването използва LoRA върху проекциите на вниманието, без промяна на архитектурата или целевата функция. Physis-Lang върху Cosmos3-Nano спрямо Veo 3.1 на Google:

  • PhyGenBench: 71.04 срещу 65.63
  • Physics-IQ Verified: 43.41 срещу 34.99
  • PhyGround: 69.90 срещу 69.24
  • VideoPhy-2: 68.02 срещу 68.87 за пълния набор, 62.36 срещу 58.43 за раздела Hard

Подобренията се запазват при различни базови модели: +7.05 при Wan2.1-14B, +3.24 при Cosmos3-Edge-4B, +6.22 при Cosmos3-Nano-16B и +5.02 при Cosmos3-Super-64B. Общото качество остава стабилно при VBench-I2V, където Cosmos3-Nano се повишава от 88.32 на 88.69.

Самото подаване на подканата също помага. Физическото разсъждение плюс отрицателните подкани повишават резултата на замразения Cosmos3-Nano при PhyGenBench от 61.67 на 67.29.

Може ли да работи без комерсиални API?

Изследователският екип дестилира GPT конвейера в 2 модела Qwen3-VL-4B-Instruct: PhysThinker-C за създаване на описания и PhysThinker-U за увеличаване на подканите. При Wan2.1-14B комерсиалният конвейер дава +7.05 при приблизителна цена за API от $24.12K. Замяната му с PhysThinker-C запазва +6.76 при цена от около $0.12K. Напълно локалната конфигурация струва $0 и все пак добавя +4.76.

Physis-Lang спрямо най-близките конкуренти

ФункцияPhysis-LangPhiZeroPhyGDPOСамоусъвършенстване
РазработчикNVIDIA, MIT, ОксфордCASIA (NLPR)Meta (ECCV 2026)Liu et al.
Основна идеяСаморазвиващи се описания на физиката на естествен език и отрицателни подканиНаучен дискретен „физичен език“, разсъждение и след това рендериранеГрупово DPO с награди за физика от VLMМултимодално поетапно усъвършенстване на подканата с обратна връзка от VLM
Къде се прилага физикатаСелекция на данни, описания за обучение и подкани при извежданеРазсъждаващ модел Qwen3-VL-4B, подаващ информация към дифузионен декодерОбучение с предпочитания върху PhyVidGen-135KСамо подкани при извеждане
Необходимо обучениеLoRA SFT (режимът само с подкани също помага)ДаДа (DPO)Не, без обучение
Physics-IQ Verified43.4140.91н/д27.20
PhyGenBench71.04н/д48.9649.17
VideoPhy-2 (Всички / Трудни)68.02 / 62.36н/д59.56 / 44.9447.88 / 28.09
PhyGround69.9057.85н/д58.22
Публични код / теглаСамо статията„Очаквайте скоро“„Ще бъдат публикувани скоро“Статия

Оценките са от статията за Physis-Lang, таблици 1 до 4, изпълнени по един протокол за всеки бенчмарк (PhyGenBench и VideoPhy-2 използват оценител GPT-5.5). Числата за Physis-Lang използват базовия модел Cosmos3-Nano. н/д = няма данни в това сравнение. Статусът на публикуване е проверен на 30 септември 2026 г.

Основни изводи

  • Physis-Lang развива описанията на физиката чрез агент, ръководен от критик, докато моделът за създаване на описания остава замразен.
  • PhysCapBench оценява описанията по 3 794 проверени от хора твърдения за причини, закони и ефекти.
  • Cosmos3-Nano с Physis-Lang превъзхожда Veo 3.1 в 3 от 4 бенчмарка.
  • Само физическите подкани повишават резултата на замразения модел с 5.62 точки при PhyGenBench.
  • Все още няма публично достъпни код или тегла; публикувана е само статията.

Разгледайте статията, страницата на проекта и GitHub хранилището. Всички заслуги принадлежат на изследователя на този проект. Също така, не се колебайте да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit за машинно обучение с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Сега можете да се присъедините към нас и в Telegram.

Имате нужда от партньор за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face ИЛИ продуктово представяне ИЛИ уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини