Знакомьтесь с «Code-as-World»: агентный цикл, преобразующий реальные видео в исполняемые физические программы MuJoCo
MirroS выпустила Code-as-World — парадигму, которая представляет физические миры через исполняемые представления мира. Аргумент узкий и проверяемый: пиксели являются свидетельством существования физической сцены, но не её онтологией. Видеомодель может предсказывать правдоподобные кадры, так и не представляя массу, контакт или гравитацию. Поэтому вместо пикселей, латентных представлений или подписей Code-as-World представляет сцену как исполняемый код — файл scene.json, который может запускать MuJoCo, который агент может сверять с исходным видео и который любой может редактировать и повторно симулировать. Агентный цикл восстанавливает такие программы из реальных видеозаписей максимум за пять раундов. Затем проверенные миры становятся обучающими данными с точными физическими метками, которых в реальном видео нет. Обученная на таких данных модель Code-as-World-VL-9B набирает 55.4 MRA на валидации QuantiPhy, опережая Gemini-3.1 Flash с результатом 54.8 и примерно на 15 пунктов превосходя сильнейшую модель с открытыми весами.
Готова ли система к развёртыванию?
Да, на уровне исследовательских задач и внутренних прототипов. MirroS опубликовала репозиторий на GitHub и два чекпойнта — Code-as-World-VL-4B и Code-as-World-VL-9B — по лицензии Apache 2.0, дообученные на основе Qwen3.5-4B и Qwen3.5-9B. Обе модели используют BF16 safetensors и обслуживаются через vLLM за OpenAI-совместимой конечной точкой /v1, обрабатывая по 16 выбранных кадров на видео и с параметром --max-model-len 4608.
Идея: пиксели — свидетельство, а не онтология
В техническом отчёте MirroS утверждается, что видеомодели, 3D-реконструкция и подписи восстанавливают лишь отдельные части сцены, но ни один из этих подходов не восстанавливает её механизм. Code-as-World представляет сцену как исполняемое представление мира (EWR) — тройку p = (C, E, A):
- Композиция: объекты, геометрия, метрические размеры, масса, трение, гравитация. Полы и стены являются статичными физическими сущностями, поэтому они могут поддерживать объекты и сталкиваться с ними.
- Эволюция: начальные состояния, силы, контакты, столкновения, условия завершения, длительность. Выполнение программы разворачивает композицию в полную траекторию состояний.
- Внешний вид: камера, освещение, материалы, фон, частота кадров, конфигурация рендеринга. Его изменение никогда не меняет физику.
В выпущенной реализации эта тройка компилируется в файл scene.json, выполняемый в MuJoCo, с двумя взаимозаменяемыми движками: анимационным (кинематические позы) и физическим (силы и контакты).
Агентное обнаружение вместо предсказания за один проход
Восстановление EWR из видео является обратной задачей, поэтому команда формулирует её как абдуктивный поиск. Агент выполняет цикл предложить → создать экземпляр → выполнить → отрендерить → проверить максимум в течение K = 5 раундов. Для входного видео SAM 3 предоставляет маски экземпляров и треки на плоскости изображения, VGGT-Omega оценивает глубину и геометрию камеры, а SAM 3D создаёт сетки для отдельных объектов. Кандидатные развёртки проецируются обратно во входной ракурс и сравниваются на выбранных ключевых кадрах по RGB, глубине, маскам и траекториям. Расхождения на уровне кадров объединяются в структурированную обратную связь Δ, которая направляет следующую итерацию; если бюджет исчерпан без принятия гипотезы, она отклоняется.
При одинаковом бюджете в пять оценок этот цикл превосходит независимую выборку Best-of-5 по Visual Alignment, Object IoU, Traj-ADE и Accuracy@2%D — и результат повторяется при использовании второго движка выполнения. Кандидатные видео взяты из WISA-80K после фильтрации по признаку движения; повторный рендеринг sim-to-real выполняется с использованием Wan2.2-VACE и внутренней видеомодели.
Проверенные миры как обучающая супервизия
На первом этапе выполняется контролируемая тонкая настройка на 73 335 парах вопросов и ответов в пространстве изображений, созданных на основе RefCOCO/+/g, RefCLEF и GOT-10K и охватывающих протяжённость, положение, смещение, скорость и ускорение в исходных пикселях. На втором этапе применяется GRPO к VQA в пространстве мира, полученным из 1 585 текстовых и 988 видеоуправляемых исполняемых миров; вознаграждение рассчитывается на основе нормализованной по масштабу числовой точности, а также компонентов за единицы измерения и формат. Для обучения использовались восемь графических процессоров NVIDIA H100.
На валидации QuantiPhy (159 элементов, MRA — макроусреднённое значение по 2S/2D/3S/3D): 4B = 50.6, 9B = 55.4, 27B reasoning = 58.6, тогда как Gemini-3.1 Flash набрала 54.8, ChatGPT-5.1 — 48.4, а сильнейшая модель с открытыми весами Qwen3-VL-32B-Instruct — 40.2. Более полезным показателем является абляционное исследование: обучение только на данных из пространства изображений даёт 44.2 (4B) и 50.9 (9B); добавление обоих источников из пространства мира повышает результаты до 50.6 и 55.4. Привязка на уровне пикселей также улучшается: после RL в пространстве мира результат 9B повышается с 63.7 до 68.3 на RefCOCO и с 20.1 до 26.6 на GOT-10K.
Основные выводы
- Code-as-World превращает видео в редактируемый
scene.json, который MuJoCo может выполнить и проверить. - Пятираундовый поиск «предложить→проверить» превосходит выборку Best-of-5 при том же вычислительном бюджете.
- Проверенные миры предоставляют точные физические метки, которых в реальном видео попросту нет.
- 9B достигает 55.4 MRA на QuantiPhy, опережая Gemini-3.1 Flash с результатом 54.8; модели 4B и 9B распространяются по лицензии Apache 2.0.
- Поддерживаются только твёрдые тела, а сама модель не обучается циклу обнаружения.
Ознакомьтесь с техническим отчётом, блогом MirroS, страницей проекта, GitHub и объявлением в X. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.
Хотите сотрудничать с нами в продвижении вашего репозитория на GitHub, страницы на Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.