Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Reward AI представила OM-1: роботизированную политику, обученную только на демонстрациях людей, без телеуправления и данных с роботов

Reward AI, стартап в области робототехники, в команду которого входят авторы таких разработок, как DexCap, HumanPlus и ALOHA, выпустил OM-1 — сокращение от Omnibody Model 1. OM-1 — это универсальная политика манипуляции, которая обучается на данных от людей, носящих перчатку с датчиками, а затем работает на промышленных манипуляторах и гуманоидных роботах с человеческой скоростью. Главный вывод: для обучения не используются ни данные телеприсутствия, ни данные, собранные на роботах. Система следует одному принципу: «Одна модель, один интерфейс данных, любое тело».

Можно ли внедрить систему? Нет, OM-1 — это внутренняя политика Reward AI. Веса, код, набор данных или API не опубликованы, поэтому разработчики пока не могут запустить систему на собственном оборудовании.

Зачем отказываться от данных роботов?

Большинство базовых робототехнических политик обучаются на данных телеприсутствия или данных, самостоятельно собранных роботами, что привязывает набор данных к одному варианту воплощения. В Reward AI утверждают, что манипуляции на уровне человека не появятся благодаря большему объёму таких данных или дополнительным вычислительным ресурсам, ссылаясь на работу Андерсона «More Is Different». Вместо этого сбор данных, обучение и управление проектируются как единый конвейер, поэтому демонстрации, записанные сегодня, могут обучать роботизированные тела, которых ещё не существует.

Omnibody Hand: носимое устройство с 7 степенями свободы

Основой комплекса служит Omnibody Hand — носимое устройство, развивающее предыдущие наработки команды в области портативного захвата движений, включая DexCap. Вместо копирования каждого сустава человеческой кисти оно представляет собой конструкцию с семью степенями свободы, созданную вокруг наиболее важных функций: выбора точек контакта, переориентации объектов в руке и переключения между точными и силовыми захватами. Устройство фиксирует щипковый захват большим и указательным пальцами, сгибание большого и указательного пальцев, а также совместное движение среднего, безымянного пальцев и мизинца в пястно-фаланговых суставах.

Эргономика рассматривается как вопрос качества данных: устройство, которое смещается или ограничивает движения пользователя, приводит к компенсаторному захвату. Механизм дистального сгибания компенсирует различия в длине пальцев, поэтому индивидуальная настройка для каждого пользователя не требуется.

Один интерфейс данных: фиксация контакта с человеческой скоростью

Один интерфейс данных превращает движения пользователя в обучающие данные без постановочной подготовки и без наблюдающего оператора. Целевой сценарий — сортировка на конвейере, когда человек замечает объект, хватает его и бросает за долю секунды. Чтобы охватить всё взаимодействие, перчатка объединяет высокочастотное тактильное зондирование, датчики близости для подхода до контакта и камеры с глобальным затвором, установленные на кисти, которые сохраняют контекст при быстрых движениях.

Отслеживание позы кисти — первое количественное достижение, о котором сообщает Reward AI. Визуально-инерциальное отслеживание является распространённым стандартом, однако его точность при быстрых разворотах ограничена частотой обновления изображения. Reward AI дополняет его электромагнитным зондированием и компенсацией возмущений. При перемещении обоих трекеров между двумя механическими ограничителями на восьми скоростях — от 3 до 67 см/с — и усреднении результатов десяти запусков для каждой скорости электромагнитное отслеживание показало рост средней ошибки перелёта примерно с 0,4 до 9,5 мм, тогда как визуально-инерциальное — примерно с 2,1 до 24,9 мм: сокращение на 60% на максимальной скорости при меньшем разбросе результатов между запусками. Сила регистрируется по той же траектории, поэтому демонстрации содержат информацию не только о пути, но и о прилагаемом усилии.

OM-1: одна политика, одноэтапное обучение

OM-1 учится напрямую генерировать действия робота на основе движений человека, а не направлять поведение через промежуточного робота. Поскольку каждая демонстрация поступает в одном и том же формате, разделения на предварительное и последующее обучение нет: самая первая записанная демонстрация и самая новая обучают одну политику на одном этапе.

Входные данные — мультимодальные потоки с перчатки: изображения, тактильные сигналы, данные о расстоянии между пальцами и траектории позы кисти. Каждая модальность обрабатывается с собственной исходной частотой дискретизации датчика, а не приводится к общей частоте, поэтому высокочастотные тактильные и двигательные сигналы сохраняются наряду с низкочастотным зрением. Выходные данные содержат направление движения, скорость, силу и время таких событий, как начало захвата. В Reward AI заявляют, что создали новую архитектуру для эффективного вывода, однако детали архитектуры и количество параметров не раскрываются.

Управление любым телом: слой RL со своими тактами

Под политикой находится высокочастотный слой управления, обученный с помощью обучения с подкреплением в симуляции для работы с динамикой, зависящей от скорости и ускорения, внешними возмущениями и системными задержками. Если классический контроллер, сбитый с опорной траектории неожиданной нагрузкой, уже не восстанавливается, этот слой удерживает заданную траекторию и возвращается к ней, благодаря чему робот может открыть полностью закрытую дверцу холодильника или поднять коробки неизвестного веса.

Слой управления работает по собственным тактам, продолжая работу, пока политика вычисляет следующие действия, поэтому задержка вывода никогда не останавливает движение. Поскольку последовательные прогнозы могут не соединяться плавно, система оптимизирует переход между ними в режиме онлайн. Одно и то же пространство действий охватывает манипуляции и навигацию мобильных роботов.

Результаты

В Reward AI сообщают, что OM-1 осваивает совершенно новую задачу, включая сложную динамику и длинные горизонты планирования, менее чем за 30 минут человеческих данных, и связывают это с интегрированным комплексом, а не только с политикой. На её странице «О нас» указано, что все опубликованные видеоролики воспроизводятся на скорости 1x, а модель работает с манипуляторами, шагающими гуманоидными роботами и колёсными мобильными манипуляторами. Данные об успешности, сравнения с общедоступными базовыми методами или научная статья не опубликованы, поэтому эти заявления подтверждены демонстрациями, а не результатами тестов на бенчмарках.

Основные выводы

  • OM-1 обучается только на человеческих демонстрациях, полученных с помощью носимой перчатки с 7 степенями свободы; данные телеприсутствия и данные роботов не используются.
  • Электромагнитное отслеживание сократило среднюю ошибку перелёта на 60% при скорости 67 см/с по сравнению с визуально-инерциальным (9,5 мм против 24,9 мм).
  • Каждый поток данных с датчиков сохраняет исходную частоту; слой управления RL работает по собственным тактам.
  • По данным Reward AI, новая задача осваивается менее чем за 30 минут данных.

Ознакомьтесь с техническими подробностями здесь. Вся заслуга принадлежит исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тыс. участников и подписаться на нашу рассылку. Подождите! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.

Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости