Axis Robotics випускає AXIS: браузерний рушій даних із 207 завданнями з маніпулювання роботами та 50 129 траєкторіями
Набори даних для маніпуляцій роботів зростали набагато повільніше, ніж моделі, на яких їх навчають, здебільшого тому, що їхнє збирання залишається закритим і централізованим. Оператори-експерти збирають демонстрації на лабораторному обладнанні, обробляють їх офлайн і випускають фіксований бенчмарк, який більше ніколи не розширюється. Дослідницька команда з Axis Robotics, Каліфорнійського університету в Берклі, Georgia Tech, NTU… пропонує інший підхід до цієї проблеми. Їхня система AXIS переносить збирання демонстрацій у браузер, надсилає все інше на серверні GPU та розглядає набір даних як такий, що постійно розширюється, а не як те, що випускається один раз.
Чи придатна система для розгортання? Частково. Код навчання опублікований як патч-рівень поверх OpenPI, а платформа телеоперації працює в будь-якому браузері. Набір даних на Hugging Face має обмежений доступ, займає 2,36 ТБ і призначений лише для некомерційного академічного використання. Контрольні точки політики не опубліковані.
Розподіл між браузером і серверною частиною
Ключове системне рішення — асиметрія. Учасники керують Franka Research 3 з паралельним захватом у фронтенді MuJoCo WebAssembly, використовуючи клавіатуру, мишу, віртуальний джойстик або геймпад. Фізичні обчислення та рендеринг Three.js виконуються поза потоком інтерфейсу React, тому зареєстровані зразки стан-дія залишаються синхронізованими із симулятором, а не з інтерфейсом. Усе ресурсоємне відбувається в іншому місці: рендеринг — на 8 GPU RTX 4090, навчання й оцінювання — на 8 GPU A100.
Самі завдання генеруються, а не створюються вручну. TaskGen розкладає мовну інструкцію на конфігурації завдання, сцени та об’єктів, отримує або генерує сітки за допомогою конвеєра перетворення зображення на 3D, масштабує їх до правдоподібного фізичного розміру, а потім пропонує 2,5D-розташування. Супервізор розташування перевіряє створену сцену й переміщує, переорієнтовує або повторно генерує об’єкти, коли обмеження не виконуються. Кожне завдання постачається зі структурованою перевіркою успішності, яку серверна частина запускає повторно, не покладаючись на прапорець успішності фронтенду.
Що містить набір даних
Опублікований знімок містить 207 завдань, 50 129 епізодів і понад 60 тисяч варіантів завдань або сцен у семи категоріях сцен. Кожна траєкторія містить метадані завдання, конфігурацію робота, версію симулятора, стани робота й об’єктів, дії, мітки успішності, а також RGB-D-спостереження з третьої особи та з камери на зап’ясті. У статті зазначено, що внески зробили понад 70 000 учасників спільноти.
Очищення розглядається як виробничий етап. Зразки зі зміною суглобів меншою за 5e-3 відкидаються як статичні, фільтр Савицького—Ґолея з вікном 15 і поліноміальним порядком 3 згладжує безперервний рух, а кубічні сплайни змінюють частоту дискретизації з 6 Гц, яку забезпечує вебінтерфейс, до цільових 20 Гц. Таблиця 1 чесно показує компроміс: середнє прискорення знижується з 1.3539 до 0.4885, а середній ривок — з 11.5899 до 2.2243, тоді як успішність відтворення падає зі 100% до 86,2%.
Після цього очищені епізоди відтворюються в IsaacSim із упакованого стану симулятора з вимкненим виконанням фізичних обчислень, тож перевірена траєкторія залишається авторитетною, а сцени, камери, матеріали та освітлення рандомізуються навколо неї. Результатом є трасовані променями RGB-зображення розміром 256×256 із фіксованої камери третьої особи та камери на зап’ясті; глибина за замовчуванням вимкнена.
Результати на LIBERO-Plus
Кожна умова починається з опублікованої контрольної точки π0.5 — основи PaliGemma Gemma-2B з експертом дій Gemma-300M — за можливості продовжує попереднє навчання на симуляційному корпусі, а потім донавчається на LIBERO з ідентичними гіперпараметрами. Попереднє навчання виконується для всієї моделі без LoRA, із використанням функції втрат flow matching для 10-крокових фрагментів дій протягом 100 000 кроків, після чого проводиться 30 000 кроків постнавчання на LIBERO.
π0.5 плюс AXIS-100% досягає 88,8 загалом на LIBERO-Plus проти 83,9 для стандартної π0.5 і 57,5 для контрольної моделі RoboCasa365 з таким самим числом траєкторій. В анотації наведено 5,8% і 37,3%; обидва показники є відносними величинами, нормалізованими за базовим показником 83,9, тому різниця в пунктах — 4,9 і 31,3 — є більш коректним прочитанням. Масштабування зберігається на агрегованому рівні: 84,7, 85,7 і 88,8 для зрізів 25%, 50% і 100% відповідно.
За окремими осями найбільші покращення спостерігаються там, де конвеєр аугментації справді виконує рандомізацію: шум сенсора +13,7, камера +11,3. Фон дає приріст 3,7, поза робота — 3,8, розташування — 2,6. Освітлення та мова погіршуються на 1,7 і 1,3 відповідно. Показник для камери також падає до 68,8 на AXIS-50%, нижче за базові 72,5, перш ніж відновитися. Масштабування є послідовним в агрегаті, але нестабільним за окремими осями.
Інтерактивне пояснення
Ключові висновки
- 207 завдань і 50 129 перевірених траєкторій, зібраних через браузерний фронтенд MuJoCo-WASM без локального GPU чи робота.
- Безперервне попереднє навчання підвищує загальний результат π0.5 на LIBERO-Plus з 83,9 до 88,8, тобто на 4,9 пункту.
- Контрольна модель RoboCasa365 з таким самим обсягом даних набирає 57,5, тож приріст не пояснюється лише масштабом симуляції.
- Удосконалення зменшує середнє прискорення на 63,9%, а середній ривок — на 80,8%, ціною падіння успішності відтворення до 86,2%.
- За двома осями збурень — освітленням і мовою — показники погіршуються порівняно зі стандартною базовою моделлю.
Ознайомтеся з науковою статтею, сторінкою проєкту, набором даних і платформою. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого ML-сабреддіту з понад 150 тисячами учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.
Потрібна партнерська співпраця з нами для просування вашого репозиторію GitHub, сторінки на Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.