Reward AI представи OM-1: политика за управление на роботи, обучена само с човешки демонстрации, без телеуправление или данни от роботи
Reward AI, стартъп в областта на роботиката, чийто екип има предишен опит, включващ DexCap, HumanPlus и ALOHA, представи OM-1, съкращение от Omnibody Model 1. OM-1 е универсална политика за манипулация, която се обучава от хора, носещи ръкавица със сензори, а след това работи върху индустриални роботизирани рамена и хуманоиди с човешка скорост. Ключовото откритие е: при обучението не се използват нито данни от телеоперация, нито данни от роботи. Системата следва един принцип: „Един модел, един интерфейс за данни, всяко тяло“.
Може ли да бъде внедрена? Не, OM-1 е вътрешна политика на Reward AI. Не са публикувани тегла, код, набор от данни или API, така че разработчиците все още не могат да я използват на собствен хардуер.
Защо да се пропуснат данните от роботи?
Повечето фундаментални политики за роботи се обучават върху данни от телеоперация или данни, събрани от самите роботи, което обвързва набора от данни с конкретно роботизирано тяло. Reward AI твърди, че манипулация на човешко ниво няма да бъде постигната чрез повече такива данни или повече изчислителна мощ, позовавайки се на „More Is Different“ на Андерсън. Вместо това заснемането, обучението и управлението са проектирани като единен конвейер, така че демонстрациите, записани днес, да могат да обучават роботизирани тела, които все още не съществуват.
Omnibody Hand: Носимо устройство със 7 степени на свобода
Системата започва с Omnibody Hand — носимо устройство, което надгражда по-ранната работа на екипа по DexCap в областта на преносимото улавяне на движения. Вместо да копира човешката ръка става по става, то е проектирано със седем степени на свобода и е изградено около функциите, които имат значение: избор на контактни точки, преориентиране на предмети в ръката и преминаване между прецизни и силови захвати. То улавя прищипването с палеца и показалеца, сгъването на палеца и показалеца и свързаното движение на средния, безименния и малкия пръст в MCP ставите.
Ергономията се разглежда като въпрос на качеството на данните: устройство, което се плъзга или ограничава носещия го човек, води до компенсиран захват. Дисталният механизъм за сгъване компенсира разликите в дължината на пръстите, така че не е необходимо индивидуално регулиране за всеки потребител.
Един интерфейс за данни: Улавяне на контакт с човешка скорост
Единният интерфейс за данни превръща движенията на носещия устройството човек в данни за обучение, без предварително подготвена конфигурация и без надзорник. Целта е сортиране на конвейерна лента, при което човек забелязва, хваща и хвърля предмет за части от секундата. За да обхване цялото взаимодействие, ръкавицата комбинира високочестотно тактилно измерване, сензори за близост при приближаването преди контакт и камери с глобален затвор, разположени в ръката, които запазват контекста при бързо движение.
Проследяването на позата на ръката е мястото, където Reward AI съобщава за първия си количествен резултат. Визуално-инерциалното проследяване е обичайният стандартен подход, но точността му при бързи обръщания е ограничена от честотата на визуалното обновяване. Reward AI го допълва с електромагнитно измерване и компенсация на смущенията. При преместване на двата тракера между два механични ограничителя с осем скорости от 3 до 67 cm/s, осреднено за по десет опита при всяка скорост, електромагнитното проследяване увеличава средната грешка от превишаване от около 0,4 mm до 9,5 mm, докато визуално-инерциалното се увеличава от около 2,1 mm до 24,9 mm: 60% намаление при най-високата скорост, с по-малък разброс между отделните опити. Силата се записва по същата траектория, така че демонстрациите съдържат както усилието, така и пътя.
OM-1: Една политика, едноетапно обучение
OM-1 се научава да генерира действията на робота директно от човешките движения, вместо да насочва поведението през междинен робот. Тъй като всяка демонстрация пристига в един и същ формат, няма разделение между предварително обучение и последващо обучение: първата записана демонстрация и най-новата обучават една политика в един етап.
Входовете са многомодалните потоци от ръкавицата: изображения, тактилни сигнали, близост между пръстите и траектории на позата на ръката. Всяка модалност се обработва с естествената честота на дискретизация на нейния сензор, вместо да се преобразува към обща честота, така че високочестотните тактилни сигнали и сигнали за движение да се запазят наред с визуалната информация с по-ниска честота. Изходите съдържат посока на движение, скорост, сила и времето на събития като започването на захвата. Reward AI заявява, че е изградила нова архитектура за ефективно извеждане, макар че подробностите за архитектурата и броят на параметрите не са оповестени.
Управление на всяко тяло: RL слой със собствен тактовник
Под политиката се намира високочестотен слой за управление, обучен чрез обучение с подсилване в симулация, който се справя с динамика, зависеща от скоростта и ускорението, външни смущения и системни закъснения. Докато класически контролер, отклонен от референтната си стойност от неочакван товар, никога не се възстановява, този слой запазва референтната стойност и се връща към нея, което позволява на робота да отвори напълно затворена врата на хладилник или да повдигне кутии с неизвестно тегло.
Слоят за управление работи със собствен тактовник и продължава да функционира, докато политиката изчислява следващите действия, така че латентността при извеждането никога да не спира движението. Тъй като последователните прогнози може да не се съединяват плавно, той оптимизира прехода между тях онлайн. Същото пространство на действията обхваща манипулацията и навигацията за мобилни роботи.
Резултати
Reward AI съобщава, че OM-1 усвоява напълно нова задача, включително предизвикателна динамика и дълги времеви хоризонти, от по-малко от 30 минути човешки данни, и отдава това на интегрираната система, а не само на политиката. Неговата страница „За нас“ посочва, че всички публикувани клипове се възпроизвеждат с 1x скорост и че моделът обхваща рамена, хуманоиди с крака и колесни мобилни манипулатори. Не са публикувани нива на успеваемост, сравнения с публични базови резултати или научна статия, така че тези твърдения са подкрепени от демонстрации, а не от бенчмаркове.
Основни изводи
- OM-1 се обучава единствено върху човешки демонстрации от носима ръкавица със 7 степени на свобода; няма данни от телеоперация или роботи.
- Електромагнитното проследяване намалява средната грешка от превишаване с 60% при 67 cm/s в сравнение с визуално-инерциалното проследяване (9,5 mm спрямо 24,9 mm).
- Всеки сензорен поток запазва естествената си честота; RL слоят за управление работи със собствен тактовник.
- Нова задача се усвоява от по-малко от 30 минути данни според Reward AI.
Вижте техническите подробности тук. Цялата заслуга е на изследователя на този проект. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Сега можете да се присъедините към нас и в Telegram.
Имате нужда от партньорство с нас за популяризиране на вашето GitHub хранилище, страница в Hugging Face, представяне на продукт, уебинар и т.н.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.