Axis Robotics пуска AXIS: базиран на браузър механизъм за данни с 207 задачи за манипулиране на роботи и 50 129 траектории
Наборите от данни за роботизирана манипулация нарастват много по-бавно от моделите, обучавани върху тях, главно защото събирането им остава затворено и централизирано. Експертни оператори събират демонстрации върху лабораторен хардуер, обработват ги офлайн и предоставят фиксиран бенчмарк, който повече не се разраства. Изследователски екип от Axis Robotics, UC Berkeley, Georgia Tech, NTU… предлага различен подход към проблема. Тяхната система, AXIS, прехвърля събирането на демонстрации в браузъра, изпраща всичко останало към бекенд графични процесори и разглежда набора от данни като нещо, което продължава да се разширява, а не като нещо, което се предоставя еднократно.
Може ли да бъде внедрена? Частично. Кодът за обучение е публичен като слой с корекции върху OpenPI, а платформата за телеоперация работи във всеки браузър. Наборът от данни в Hugging Face е ограничен до 2,36 TB и е достъпен само за некомерсиална академична употреба. Не са публикувани контролни точки на политиката.
Разделението между браузъра и бекенда
Основното системно решение е асиметрията. Участниците телеуправляват Franka Research 3 с грайфер с паралелни челюсти във фронтенд на MuJoCo WebAssembly, използвайки клавиатура, мишка, виртуален джойстик или геймпад. Изчисляването на физиката и визуализацията чрез Three.js се изпълняват извън нишката на React потребителския интерфейс, така че регистрираните двойки състояние-действие да остават синхронизирани със симулатора, а не с интерфейса. Всичко ресурсоемко се случва на друго място: визуализацията върху 8x RTX 4090 графични процесора, а обучението и оценяването върху 8x A100 графични процесора.
Самите задачи се генерират, вместо да се създават ръчно. TaskGen декомпозира инструкция на естествен език в конфигурации на задачата, сцената и обектите, извлича или генерира мрежи чрез конвейер за преобразуване на изображения в 3D, преоразмерява ги до правдоподобен физически мащаб и след това предлага 2,5D оформление. Супервайзорът на оформлението валидира инстанцираната сцена и премества, преориентира или генерира отново обектите, когато ограниченията не са изпълнени. Всяка задача се предоставя със структуриран проверяващ механизъм за успех, който бекендът стартира повторно, вместо да се доверява на флага за успех от фронтенда.
Какво съдържа наборът от данни
Публикуваната моментна снимка съдържа 207 задачи, 50 129 епизода и повече от 60K варианта на задачи или сцени в седем категории сцени. Всяка траектория съдържа метаданни за задачата, въплъщението, версията на симулатора, състоянията на робота и обектите, действията, етикетите за успех и RGB-D наблюдения от трета камера и камерата на китката. В статията се посочва, че повече от 70 000 членове на общността са допринесли.
Почистването се разглежда като производствен етап. Пробите с изменение на ставите под 5e-3 се отхвърлят като статични, филтър на Savitzky-Golay с прозорец 15 и полиномиален ред 3 изглажда непрекъснатото движение, а кубични сплайни преизбират данните от 6 Hz до 8 Hz, които уеб интерфейсът генерира, към целева честота от 20 Hz. Таблица 1 честно показва компромиса: средното ускорение спада от 1.3539 до 0.4885, а средният тласък — от 11.5899 до 2.2243, докато успехът при възпроизвеждане намалява от 100% до 86.2%.
След това почистените епизоди се възпроизвеждат в IsaacSim от пакетирано състояние на симулатора, като изчисляването на физиката е изключено, така че проверената траектория да остане водеща, докато сцените, камерите, материалите и осветлението се рандомизират около нея. Резултатът е 256×256 лъчево проследявано RGB изображение от фиксирана камера от трета гледна точка и камера на китката, като дълбочината е изключена по подразбиране.
Резултати върху LIBERO-Plus
Всяко условие започва от публикуваната контролна точка π0.5 — гръбнак PaliGemma Gemma-2B с експерт за действия Gemma-300M — след което по избор продължава предварителното обучение върху симулационен корпус и накрая се дообучава върху LIBERO с идентични хиперпараметри. Предварителното обучение е върху целия модел без LoRA, като използва загуба от съпоставяне на потоци върху 10-стъпкови фрагменти от действия за 100 000 стъпки, последвани от 30 000 стъпки последващо обучение върху LIBERO.
π0.5 плюс AXIS-100% достига общ резултат 88.8 в LIBERO-Plus спрямо 83.9 за стандартния π0.5 и 57.5 за контролен модел RoboCasa365, съпоставен по брой траектории. В резюмето се посочват 5.8% и 37.3%; и двете са относителни стойности, нормализирани спрямо базовата стойност 83.9, така че разликите в точки от 4.9 и 31.3 са по-ясната интерпретация. Мащабирането се запазва на агрегирано ниво — 84.7, 85.7 и 88.8 съответно при моментните снимки от 25%, 50% и 100%.
По оси най-големите подобрения се наблюдават там, където конвейерът за аугментация действително извършва рандомизация: Сензорен шум +13.7 и Камера +11.3. Фонът се подобрява с 3.7, позата на робота — с 3.8, а оформлението — с 2.6. Осветлението и езикът се влошават съответно с 1.7 и 1.3. Камерата също спада до 68.8 при AXIS-50%, под базовите 72.5, преди да се възстанови. Мащабирането е последователно на агрегирано ниво и непостоянно по отделните оси.
Интерактивно обяснение
Основни изводи
- 207 задачи и 50 129 проверени траектории, събрани чрез браузърен фронтенд с MuJoCo-WASM, без локален графичен процесор или робот.
- Продължаващото предварително обучение повишава общия резултат на π0.5 от 83.9 до 88.8 в LIBERO-Plus — подобрение от 4.9 точки.
- Контролният модел RoboCasa365, съпоставен по обем, постига 57.5, така че подобрението не може да се обясни само с обема на симулацията.
- Усъвършенстването намалява средното ускорение с 63.9% и средния тласък с 80.8%, за сметка на спад на успеха при възпроизвеждане до 86.2%.
- Две оси на смущенията — Осветление и Език — показват по-лоши резултати спрямо стандартния базов модел.
Разгледайте статията, страницата на проекта, набора от данни и платформата. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit за машинно обучение с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.
Имате нужда от партньорство с нас за популяризиране на вашето GitHub хранилище, страница в Hugging Face, продуктово представяне, уебинар и т.н.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.