Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← К новостям

Знакомьтесь с «Code-as-World»: агентный цикл, преобразующий реальные видео в исполняемые физические программы MuJoCo

MirroS выпустила Code-as-World — парадигму, которая представляет физические миры через исполняемые представления мира. Аргумент узкий и проверяемый: пиксели являются свидетельством существования физической сцены, но не её онтологией. Видеомодель может предсказывать правдоподобные кадры, так и не представляя массу, контакт или гравитацию. Поэтому вместо пикселей, латентных представлений или подписей Code-as-World представляет сцену как исполняемый код — файл scene.json, который может запускать MuJoCo, который агент может сверять с исходным видео и который любой может редактировать и повторно симулировать. Агентный цикл восстанавливает такие программы из реальных видеозаписей максимум за пять раундов. Затем проверенные миры становятся обучающими данными с точными физическими метками, которых в реальном видео нет. Обученная на таких данных модель Code-as-World-VL-9B набирает 55.4 MRA на валидации QuantiPhy, опережая Gemini-3.1 Flash с результатом 54.8 и примерно на 15 пунктов превосходя сильнейшую модель с открытыми весами.

Готова ли система к развёртыванию?

Да, на уровне исследовательских задач и внутренних прототипов. MirroS опубликовала репозиторий на GitHub и два чекпойнта — Code-as-World-VL-4B и Code-as-World-VL-9B — по лицензии Apache 2.0, дообученные на основе Qwen3.5-4B и Qwen3.5-9B. Обе модели используют BF16 safetensors и обслуживаются через vLLM за OpenAI-совместимой конечной точкой /v1, обрабатывая по 16 выбранных кадров на видео и с параметром --max-model-len 4608.

Идея: пиксели — свидетельство, а не онтология

В техническом отчёте MirroS утверждается, что видеомодели, 3D-реконструкция и подписи восстанавливают лишь отдельные части сцены, но ни один из этих подходов не восстанавливает её механизм. Code-as-World представляет сцену как исполняемое представление мира (EWR) — тройку p = (C, E, A):

  • Композиция: объекты, геометрия, метрические размеры, масса, трение, гравитация. Полы и стены являются статичными физическими сущностями, поэтому они могут поддерживать объекты и сталкиваться с ними.
  • Эволюция: начальные состояния, силы, контакты, столкновения, условия завершения, длительность. Выполнение программы разворачивает композицию в полную траекторию состояний.
  • Внешний вид: камера, освещение, материалы, фон, частота кадров, конфигурация рендеринга. Его изменение никогда не меняет физику.

В выпущенной реализации эта тройка компилируется в файл scene.json, выполняемый в MuJoCo, с двумя взаимозаменяемыми движками: анимационным (кинематические позы) и физическим (силы и контакты).

Агентное обнаружение вместо предсказания за один проход

Восстановление EWR из видео является обратной задачей, поэтому команда формулирует её как абдуктивный поиск. Агент выполняет цикл предложить → создать экземпляр → выполнить → отрендерить → проверить максимум в течение K = 5 раундов. Для входного видео SAM 3 предоставляет маски экземпляров и треки на плоскости изображения, VGGT-Omega оценивает глубину и геометрию камеры, а SAM 3D создаёт сетки для отдельных объектов. Кандидатные развёртки проецируются обратно во входной ракурс и сравниваются на выбранных ключевых кадрах по RGB, глубине, маскам и траекториям. Расхождения на уровне кадров объединяются в структурированную обратную связь Δ, которая направляет следующую итерацию; если бюджет исчерпан без принятия гипотезы, она отклоняется.

При одинаковом бюджете в пять оценок этот цикл превосходит независимую выборку Best-of-5 по Visual Alignment, Object IoU, Traj-ADE и Accuracy@2%D — и результат повторяется при использовании второго движка выполнения. Кандидатные видео взяты из WISA-80K после фильтрации по признаку движения; повторный рендеринг sim-to-real выполняется с использованием Wan2.2-VACE и внутренней видеомодели.

Проверенные миры как обучающая супервизия

На первом этапе выполняется контролируемая тонкая настройка на 73 335 парах вопросов и ответов в пространстве изображений, созданных на основе RefCOCO/+/g, RefCLEF и GOT-10K и охватывающих протяжённость, положение, смещение, скорость и ускорение в исходных пикселях. На втором этапе применяется GRPO к VQA в пространстве мира, полученным из 1 585 текстовых и 988 видеоуправляемых исполняемых миров; вознаграждение рассчитывается на основе нормализованной по масштабу числовой точности, а также компонентов за единицы измерения и формат. Для обучения использовались восемь графических процессоров NVIDIA H100.

На валидации QuantiPhy (159 элементов, MRA — макроусреднённое значение по 2S/2D/3S/3D): 4B = 50.6, 9B = 55.4, 27B reasoning = 58.6, тогда как Gemini-3.1 Flash набрала 54.8, ChatGPT-5.1 — 48.4, а сильнейшая модель с открытыми весами Qwen3-VL-32B-Instruct — 40.2. Более полезным показателем является абляционное исследование: обучение только на данных из пространства изображений даёт 44.2 (4B) и 50.9 (9B); добавление обоих источников из пространства мира повышает результаты до 50.6 и 55.4. Привязка на уровне пикселей также улучшается: после RL в пространстве мира результат 9B повышается с 63.7 до 68.3 на RefCOCO и с 20.1 до 26.6 на GOT-10K.

Основные выводы

  • Code-as-World превращает видео в редактируемый scene.json, который MuJoCo может выполнить и проверить.
  • Пятираундовый поиск «предложить→проверить» превосходит выборку Best-of-5 при том же вычислительном бюджете.
  • Проверенные миры предоставляют точные физические метки, которых в реальном видео попросту нет.
  • 9B достигает 55.4 MRA на QuantiPhy, опережая Gemini-3.1 Flash с результатом 54.8; модели 4B и 9B распространяются по лицензии Apache 2.0.
  • Поддерживаются только твёрдые тела, а сама модель не обучается циклу обнаружения.

Ознакомьтесь с техническим отчётом, блогом MirroS, страницей проекта, GitHub и объявлением в X. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.

Хотите сотрудничать с нами в продвижении вашего репозитория на GitHub, страницы на Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости