Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← Към новините

Запознайте се с „Code-as-World“: агентен цикъл, който преобразува реални видеозаписи в изпълними физични програми за MuJoCo

MirroS представи Code-as-World: парадигма, която представя физическите светове чрез изпълними представяния на света. Аргументът е тесен и проверим: пикселите са свидетелство за физическа сцена, а не нейната онтология. Един видео модел може да предсказва правдоподобни кадри, без никога да представя маса, контакт или гравитация. Затова вместо чрез пиксели, латентни представяния или надписи, Code-as-World представя сцената като изпълним кодscene.json, който MuJoCo може да стартира, агент може да провери спрямо изходното видео, а всеки може да редактира и симулира повторно. Агентен цикъл възстановява тези програми от реални видеозаписи в до пет рунда. След това проверените светове се превръщат в тренировъчни данни с точни физически етикети, каквито реалното видео не съдържа. Обучен с такъв надзор, Code-as-World-VL-9B постига 55.4 MRA при валидацията на QuantiPhy, над Gemini-3.1 Flash с 54.8 и приблизително с 15 точки над най-силната базова линия с отворени тегла.

Може ли да бъде внедрен?

Да, на ниво изследователски и вътрешен прототип. MirroS публикува GitHub хранилището и две контролни точки — Code-as-World-VL-4B и Code-as-World-VL-9B — под лиценз Apache 2.0, дообучени от Qwen3.5-4B и Qwen3.5-9B. И двата модела са BF16 safetensors, обслужвани чрез vLLM зад OpenAI-съвместима крайна точка /v1, с 16 семплирани кадъра от видео и --max-model-len 4608.

Идеята: пикселите са свидетелство, а не онтология

Техническият доклад на MirroS твърди, че видео моделите, 3D реконструкцията и надписите възстановяват по една част от сцената, но нито един от тях не възстановява нейния механизъм. Code-as-World представя сцената като изпълнимо представяне на света (EWR), тройка p = (C, E, A):

  • Композиция: обекти, геометрия, метрични размери, маса, триене, гравитация. Подовете и стените са статични физически обекти, за да могат да поддържат и да се сблъскват.
  • Еволюция: начални състояния, сили, контакти, сблъсъци, условия за прекратяване, продължителност. Изпълнението ѝ разгръща композицията в пълна траектория на състоянията.
  • Външен вид: камера, осветление, материали, фон, кадрова честота, конфигурация за рендериране. Промяната му никога не променя физиката.

В публикуваната реализация тази тройка се компилира в scene.json, изпълняван в MuJoCo, с два взаимозаменяеми енджина: енджин за анимация (кинематични пози) и физически енджин (сили и контакти).

Агентно откриване вместо предсказване в един ход

Възстановяването на EWR от видео е обратна задача, затова екипът я формулира като абдуктивно търсене. Агентът изпълнява предлагане → инстанциране → изпълнение → рендериране → проверка в до K = 5 рунда. За видео вход SAM 3 предоставя маски на инстанциите и траектории в равнината на изображението, VGGT-Omega оценява дълбочината и геометрията на камерата, а SAM 3D генерира мрежи за отделните обекти. Кандидатните разигравания се проектират обратно към входната гледна точка и се сравняват в избрани ключови кадри по RGB, дълбочина, маски и траектории. Несъответствията на ниво кадър се обобщават в структурирана обратна връзка Δ, която насочва следващата редакция; когато бюджетът бъде изчерпан без приемане, хипотезата се отхвърля.

При съпоставим бюджет от пет оценки цикълът превъзхожда независимото семплиране Best-of-5 по Visual Alignment, Object IoU, Traj-ADE и Accuracy@2%D — и резултатът се повтаря при използване на втория енджин за изпълнение. Кандидатните видеа идват от WISA-80K след филтриране, фокусирано върху движението; повторното рендериране sim-to-real използва Wan2.2-VACE и вътрешен видео модел.

Проверените светове като тренировъчен надзор

Фаза 1 представлява контролирано дообучаване върху 73 335 двойки въпроси и отговори в пространството на изображението, създадени от RefCOCO/+/g, RefCLEF и GOT-10K, обхващащи обхват, позиция, преместване, скорост и ускорение в сурови пиксели. Фаза 2 прилага GRPO към VQA в пространството на света, извлечени от 1 585 текстово управлявани и 988 видео управлявани изпълними светове, с награда въз основа на нормализирана спрямо мащаба числова точност, както и на условия за единици и формат. Обучението използва осем графични процесора NVIDIA H100.

При валидацията на QuantiPhy (159 елемента, MRA, усреднен макроаритметично за 2S/2D/3S/3D): 4B = 50.6, 9B = 55.4, 27B reasoning = 58.6, в сравнение с 54.8 за Gemini-3.1 Flash, 48.4 за ChatGPT-5.1 и 40.2 за най-силната базова линия с отворени тегла Qwen3-VL-32B-Instruct. По-показателното число е от аблационното изследване: само пространството на изображението постига 44.2 (4B) и 50.9 (9B); добавянето на двата източника от пространството на света повишава резултатите съответно до 50.6 и 55.4. Заземяването на ниво пиксели също се подобрява — 9B се повишава от 63.7 → 68.3 при RefCOCO и от 20.1 → 26.6 при GOT-10K след RL в пространството на света.

Ключови изводи

  • Code-as-World превръща видеото в редактируем scene.json, който MuJoCo може да изпълнява и проверява.
  • Търсенето с пет рунда „предложи→провери“ превъзхожда семплирането Best-of-5 при същия изчислителен бюджет.
  • Проверените светове предоставят точни физически етикети, каквито реалното видео просто не съдържа.
  • 9B постига 55.4 MRA при QuantiPhy, над Gemini-3.1 Flash с 54.8; 4B и 9B са под лиценз Apache 2.0.
  • Поддържат се само твърди тела, а самият модел никога не научава цикъла на откриване.

Разгледайте техническия доклад, блога на MirroS, страницата на проекта, GitHub и съобщението в X. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit за машинно обучение с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Сега можете да се присъедините към нас и в Telegram.

Имате нужда да си партнирате с нас за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face ИЛИ продуктово издание ИЛИ уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини