Axis Robotics выпускает AXIS: браузерный движок данных с 207 задачами по манипуляции роботами и 50 129 траекториями
Датасеты для манипуляций роботами росли гораздо медленнее, чем обучаемые на них модели, главным образом потому, что их сбор остаётся закрытым и централизованным. Операторы-эксперты собирают демонстрации на лабораторном оборудовании, обрабатывают их офлайн и выпускают фиксированный бенчмарк, который больше никогда не расширяется. Исследовательская команда из Axis Robotics, Калифорнийского университета в Беркли, Технологического института Джорджии, Наньянского технологического университета… предлагает изменить сам подход к этой задаче. Их система AXIS переносит сбор демонстраций в браузер, отправляет все остальные операции на серверные GPU и рассматривает датасет как постоянно расширяющийся ресурс, а не как то, что выпускается один раз.
Можно ли её развернуть? Частично. Код обучения опубликован в виде патч-слоя поверх OpenPI, а платформа телеоперации доступна в любом браузере. Датасет на Hugging Face имеет ограниченный доступ, занимает 2,36 ТБ и предназначен только для некоммерческого академического использования. Чекпойнты политики не выпущены.
Разделение браузера и бэкенда
Ключевое системное решение — асимметрия. Участники управляют Franka Research 3 с параллельным захватом внутри фронтенда MuJoCo WebAssembly, используя клавиатуру, мышь, виртуальный джойстик или геймпад. Расчёт физики и рендеринг Three.js выполняются вне потока пользовательского интерфейса React, поэтому записываемые пары состояния и действия остаются синхронизированными с симулятором, а не с интерфейсом. Все ресурсоёмкие операции выполняются в другом месте: рендеринг — на 8 GPU RTX 4090, обучение и оценка — на 8 GPU A100.
Сами задачи генерируются, а не создаются вручную. TaskGen разлагает инструкцию на естественном языке на конфигурации задачи, сцены и объектов, извлекает или генерирует меши через конвейер преобразования изображения в 3D, масштабирует их до правдоподобного физического размера, а затем предлагает двумерную с половиной размерную компоновку. Супервизор компоновки проверяет созданную сцену и перемещает, переориентирует или повторно генерирует объекты, если ограничения нарушены. Каждая задача поставляется со структурированной проверкой успешности, которую бэкенд запускает повторно, не доверяя флагу успешности фронтенда.
Что содержит датасет
Выпущенный снимок содержит 207 задач, 50 129 эпизодов и более 60 тыс. вариантов задач или сцен в семи категориях сцен. Каждая траектория включает метаданные задачи, воплощение, версию симулятора, состояния робота и объектов, действия, метки успешности, а также RGB-D-наблюдения с камеры третьего лица и камеры на запястье. Согласно статье, вклад внесли более 70 000 участников сообщества.
Очистка рассматривается как производственный этап. Образцы с изменением сочленений менее 5e-3 отбрасываются как статичные, фильтр Савицкого — Голея с окном 15 и полиномиальным порядком 3 сглаживает непрерывное движение, а кубические сплайны передискретизируют данные с частоты 6 Гц, которую выдаёт веб-интерфейс, до целевой частоты 20 Гц. Таблица 1 честно показывает компромисс: среднее ускорение снижается с 1.3539 до 0.4885, а средний рывок — с 11.5899 до 2.2243, при этом успешность воспроизведения падает со 100% до 86,2%.
Затем очищенные эпизоды воспроизводятся в IsaacSim из упакованного состояния симулятора с отключённым расчётом физики, поэтому проверенная траектория остаётся авторитетной, а сцены, камеры, материалы и источники света рандомизируются вокруг неё. На выходе получается трассированное RGB-изображение размером 256×256 с фиксированной камеры третьего лица и камерой на запястье; глубина по умолчанию отключена.
Результаты на LIBERO-Plus
Каждое условие начинается с выпущенного чекпойнта π0.5 — основы PaliGemma Gemma-2B с экспертом действий Gemma-300M; затем при необходимости продолжается предобучение на корпусе симуляции, после чего выполняется дообучение на LIBERO с идентичными гиперпараметрами. Предобучение выполняется для всей модели без LoRA с использованием функции потерь сопоставления потоков по фрагментам действий из 10 шагов в течение 100 000 шагов, после чего проводится постобучение на LIBERO в течение 30 000 шагов.
π0.5 с AXIS-100% достигает общего результата 88,8 на LIBERO-Plus против 83,9 у стандартной π0.5 и 57,5 у контрольной модели RoboCasa365, сопоставимой по числу траекторий. В аннотации приводятся значения 5,8% и 37,3%; оба являются относительными показателями, нормированными по базовому результату 83,9, поэтому разница в пунктах — 4,9 и 31,3 — выглядит более наглядно. Масштабирование сохраняется на совокупном уровне: 84,7, 85,7 и 88,8 для снимков объёмом 25%, 50% и 100% соответственно.
По отдельным осям наибольший прирост наблюдается там, где конвейер аугментации действительно выполняет рандомизацию: +13,7 для Sensor Noise и +11,3 для Camera. Background даёт прирост 3,7, Robot pose — 3,8, Layout — 2,6. Показатели Light и Language снижаются на 1,7 и 1,3 соответственно. Camera также падает до 68,8 при AXIS-50%, что ниже базового результата 72,5, а затем восстанавливается. На совокупном уровне масштабирование стабильно, а по отдельным осям результаты нестабильны.
Интерактивное объяснение
Ключевые выводы
- 207 задач и 50 129 проверенных траекторий, собранных через браузерный фронтенд MuJoCo-WASM без локального GPU или робота.
- Непрерывное предобучение повышает общий результат π0.5 на LIBERO-Plus с 83,9 до 88,8 — прирост составляет 4,9 пункта.
- Контрольная модель RoboCasa365 с сопоставимым объёмом данных набирает 57,5, поэтому прирост нельзя объяснить только объёмом симуляции.
- Уточнение снижает среднее ускорение на 63,9%, а средний рывок — на 80,8%, однако успешность воспроизведения падает до 86,2%.
- По двум осям возмущений — Light и Language — результаты снижаются по сравнению со стандартной базовой моделью.
Ознакомьтесь с статьёй, страницей проекта, датасетом и платформой. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту по машинному обучению с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь к нам можно присоединиться и в Telegram.
Хотите сотрудничать с нами для продвижения вашего репозитория GitHub, страницы на Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.