Знайомтеся з «Code-as-World»: агентний цикл, що перетворює реальні відео на виконувані фізичні програми MuJoCo
MirroS випустила Code-as-World: парадигму, яка представляє фізичні світи через виконувані представлення світу. Аргумент вузький і піддається перевірці: пікселі є свідченням фізичної сцени, а не її онтологією. Відеомодель може передбачати правдоподібні кадри, ніколи не представляючи масу, контакт або гравітацію. Тож замість пікселів, латентних представлень чи підписів Code-as-World представляє сцену як виконуваний код — файл scene.json, який може запускати MuJoCo, який агент може перевірити на відповідність вихідному відео і який будь-хто може редагувати та повторно симулювати. Агентний цикл відновлює ці програми з реальних відеозаписів максимум за п’ять раундів. Перевірені світи потім стають навчальними даними з точними фізичними мітками, яких реальне відео не містить. Навчена на таких даних модель Code-as-World-VL-9B набирає 55.4 MRA на валідації QuantiPhy, випереджаючи Gemini-3.1 Flash із результатом 54.8 і приблизно на 15 пунктів найсильнішу модель із відкритими вагами.
Чи придатна вона до розгортання?
Так, на рівні досліджень і внутрішніх прототипів. MirroS опублікувала репозиторій на GitHub і дві контрольні точки — Code-as-World-VL-4B та Code-as-World-VL-9B — за ліцензією Apache 2.0, донавчені на основі Qwen3.5-4B і Qwen3.5-9B. Обидві моделі використовують BF16 safetensors і обслуговуються через vLLM за OpenAI-сумісною кінцевою точкою /v1, із 16 вибраними кадрами на відео та параметром --max-model-len 4608.
Ідея: пікселі — це свідчення, а не онтологія
У технічному звіті MirroS стверджується, що відеомоделі, 3D-реконструкція та підписи відновлюють кожен лише частину сцени, але жоден із них не відновлює її механізм. Code-as-World представляє сцену як виконуване представлення світу (EWR) — трійку p = (C, E, A):
- Композиція: об’єкти, геометрія, метричні розміри, маса, тертя, гравітація. Підлоги та стіни є статичними фізичними сутностями, щоб вони могли підтримувати об’єкти та стикатися з ними.
- Еволюція: початкові стани, сили, контакти, зіткнення, умови завершення, тривалість. Її виконання розгортає композицію в повну траєкторію станів.
- Вигляд: камера, освітлення, матеріали, тло, частота кадрів, конфігурація рендерингу. Його зміна ніколи не змінює фізику.
У випущеній реалізації ця трійка компілюється у файл scene.json, який виконується в MuJoCo, із двома взаємозамінними рушіями: рушієм анімації (кінематичні пози) та фізичним рушієм (сили й контакти).
Агентне відкриття замість одноразового передбачення
Відновлення EWR із відео є оберненою задачею, тому команда формулює його як абдуктивний пошук. Агент виконує цикл запропонувати → створити екземпляр → виконати → відрендерити → перевірити максимум у K = 5 раундів. Для відеовходу SAM 3 надає маски екземплярів і треки на площині зображення, VGGT-Omega оцінює глибину та геометрію камери, а SAM 3D генерує 3D-сітки для кожного об’єкта. Кандидатні розгортання проєктуються назад у вхідний ракурс і порівнюються на вибраних ключових кадрах за RGB, глибиною, масками та траєкторіями. Розбіжності на рівні кадрів агрегуються у структурований зворотний зв’язок Δ, який спрямовує наступну редакцію; якщо бюджет вичерпано без прийняття, гіпотеза відхиляється.
За однакового бюджету з п’яти оцінювань цей цикл перевершує незалежне семплювання Best-of-5 за візуальним узгодженням, IoU об’єктів, Traj-ADE та Accuracy@2%D — і результат повторюється за використання другого рушія виконання. Кандидатні відео походять із WISA-80K після фільтрації, орієнтованої на рух; повторний рендеринг sim-to-real виконується за допомогою Wan2.2-VACE та внутрішньої відеомоделі.
Перевірені світи як навчальні дані
Фаза 1 — це контрольоване донавчання на 73 335 парах QA у просторі зображення, створених на основі RefCOCO/+/g, RefCLEF і GOT-10K та охоплюють протяжність, положення, переміщення, швидкість і прискорення у вихідних пікселях. Фаза 2 застосовує GRPO до VQA у просторі світу, отриманих із 1 585 світів, створених на основі тексту, і 988 світів, створених на основі відео, із винагородою за нормовану за масштабом числову точність, а також за одиниці вимірювання та формат. Для навчання використовувалися вісім графічних процесорів NVIDIA H100.
На валідації QuantiPhy (159 елементів, MRA, усереднене макросереднім значенням для 2S/2D/3S/3D): 4B = 50.6, 9B = 55.4, 27B reasoning = 58.6, тоді як Gemini-3.1 Flash набирає 54.8, ChatGPT-5.1 — 48.4, а найсильніша модель із відкритими вагами Qwen3-VL-32B-Instruct — 40.2. Найкориснішим показником є абляційне дослідження: моделі, навчені лише на просторі зображення, набирають 44.2 (4B) і 50.9 (9B); додавання обох джерел у просторі світу підвищує результати до 50.6 і 55.4. Прив’язка на рівні пікселів також покращується — показник 9B зростає з 63.7 до 68.3 на RefCOCO і з 20.1 до 26.6 на GOT-10K після RL у просторі світу.
Ключові висновки
- Code-as-World перетворює відео на редагований файл
scene.json, який MuJoCo може виконувати та перевіряти. - П’ятираундовий пошук «запропонувати → перевірити» перевершує семплювання Best-of-5 за того самого обчислювального бюджету.
- Перевірені світи надають точні фізичні мітки, яких у реальному відео просто немає.
- 9B набирає 55.4 MRA на QuantiPhy, випереджаючи Gemini-3.1 Flash із результатом 54.8; моделі 4B і 9B поширюються за ліцензією Apache 2.0.
- Лише тверді тіла, і сама модель не навчається циклу відкриття.
Ознайомтеся з технічним звітом, блогом MirroS, сторінкою проєкту, GitHub і оголошенням в X. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого 150k+ ML SubReddit та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.
Потрібно співпрацювати з нами для просування вашого репозиторію на GitHub АБО сторінки на Hugging Face АБО випуску продукту АБО вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.