Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

Reward AI представила OM-1: політику керування роботами, навчену лише на демонстраціях людей, без телеоперації та даних із роботів

Reward AI, стартап у галузі робототехніки, команда якого має у своєму доробку попередні розробки, зокрема DexCap, HumanPlus і ALOHA, представив OM-1 — скорочено від Omnibody Model 1. OM-1 — це універсальна політика маніпуляції, яка навчається на даних від людей у сенсоризованих рукавичках, а потім працює на промислових маніпуляторах і гуманоїдах із людською швидкістю. Ключовий висновок: під час навчання не використовуються дані телеоперації чи дані, зібрані на роботах. Система дотримується одного принципу: «Одна модель, один інтерфейс даних, будь-яке тіло».

Чи можна її розгорнути? Ні, OM-1 є внутрішньою політикою Reward AI. Ваги моделі, код, набір даних або API не опубліковані, тому розробники поки не можуть запустити її на власному обладнанні.

Навіщо відмовлятися від даних роботів?

Більшість фундаментальних політик для роботів навчаються на даних телеоперації або даних, самостійно зібраних роботами, що прив’язує набір даних до конкретного типу робота. У Reward AI стверджують, що маніпуляції на рівні людини не з’являться завдяки більшій кількості таких даних або більшій обчислювальній потужності, посилаючись на роботу Андерсона «More Is Different». Натомість збір даних, навчання й керування спроєктовані як єдиний конвеєр, тож демонстрації, записані сьогодні, можуть навчати роботів, яких ще не існує.

Omnibody Hand: носимий пристрій із 7 ступенями свободи

Система починається з Omnibody Hand — носимого пристрою, що розвиває попередню роботу команди над DexCap у сфері портативного захоплення рухів. Замість копіювання кожного суглоба людської кисті він має конструкцію із сімома ступенями свободи, побудовану навколо найважливіших функцій: вибору точок контакту, зміни орієнтації предметів у руці та переходу між точними й силовими захватами. Пристрій фіксує щипковий захват великим та вказівним пальцями, згинання великого й вказівного пальців, а також пов’язані рухи середнього, безіменного та мізинця в п’ястково-фалангових суглобах.

Ергономіка розглядається як питання якості даних: пристрій, що ковзає або обмежує рухи користувача, спричиняє компенсаторний захват. Механізм дистального згинання компенсує відмінності в довжині пальців, тому індивідуальне налаштування для кожного користувача не потрібне.

Один інтерфейс даних: фіксація контакту з людською швидкістю

One Data Interface перетворює рухи користувача на навчальні дані без постановочної підготовки та без наглядача. Цільовим сценарієм є сортування на конвеєрі, де людина помічає, хапає і відкидає предмет за частку секунди. Щоб охопити всю взаємодію, рукавичка поєднує високочастотне тактильне зондування, сенсори наближення для фази наближення до контакту та камери з глобальним затвором, розташовані на кисті, які зберігають контекст під час швидких рухів.

Відстеження положення кисті — це напрям, у якому Reward AI повідомляє про свій перший кількісний результат. Візуально-інерційне відстеження є поширеним стандартом, але його точність під час швидких реверсів обмежена частотою оновлення зображення. Reward AI доповнює його електромагнітним зондуванням і компенсацією збурень. Переміщуючи обидва трекери між двома механічними упорами на восьми швидкостях від 3 до 67 см/с, у середньому за десять запусків на кожній швидкості, електромагнітне відстеження показало зростання середньої похибки перерегулювання приблизно з 0,4 мм до 9,5 мм, тоді як візуально-інерційне — приблизно з 2,1 мм до 24,9 мм: скорочення на 60% за найвищої швидкості, із меншим розкидом між запусками. Сила реєструється вздовж тієї самої траєкторії, тому демонстрації містять інформацію не лише про шлях, а й про докладене зусилля.

OM-1: одна політика, одностадійне навчання

OM-1 навчається генерувати дії робота безпосередньо з рухів людини, а не передавати поведінку через проміжного робота. Оскільки кожна демонстрація надходить в одному форматі, між попереднім і подальшим навчанням немає розділення: найперша записана демонстрація та найновіша навчають одну політику на одному етапі.

Вхідними даними є мультимодальні потоки рукавички: зображення, тактильні сигнали, дані про наближення між пальцями та траєкторії положення кисті. Кожен тип даних обробляється з власною частотою дискретизації сенсора, а не знижується до спільної частоти, тому високочастотні тактильні сигнали й сигнали руху зберігаються разом із низькочастотнішим візуальним потоком. Вихідні дані містять напрямок руху, швидкість, силу та час таких подій, як початок захвату. Reward AI заявляє, що створила нову архітектуру для ефективного інференсу, однак деталі архітектури й кількість параметрів не розкриваються.

Керування будь-яким тілом: рівень RL із власним тактом

Під політикою розташований високочастотний рівень керування, навчений із підкріпленням у симуляції для роботи з динамікою, що залежить від швидкості та прискорення, зовнішніми збуреннями й системними затримками. Якщо класичний контролер, відхилений від заданого орієнтира несподіваним навантаженням, уже не відновлюється, цей рівень утримує орієнтир і повертається до нього, що дає роботу змогу відчинити повністю зачинені дверцята холодильника або підняти коробки невідомої ваги.

Рівень керування працює у власному такті, продовжуючи роботу, поки політика обчислює наступні дії, тому затримка інференсу не зупиняє рух. Оскільки послідовні передбачення можуть не поєднуватися плавно, система оптимізує перехід між ними в режимі онлайн. Той самий простір дій охоплює маніпуляції та навігацію для мобільних роботів.

Результати

Reward AI повідомляє, що OM-1 опановує абсолютно нове завдання, зокрема завдання зі складною динамікою та довгими горизонтами планування, менш ніж за 30 хвилин людських даних, і пояснює це інтегрованою системою, а не лише політикою. На її сторінці «Про нас» зазначено, що всі опубліковані відеофрагменти відтворюються зі швидкістю 1x, а модель охоплює маніпулятори, гуманоїдів на ногах і колісних мобільних маніпуляторів. Показники успішності, порівняння з відкритими базовими результатами або наукову статтю не опубліковано, тому ці твердження підтверджені демонстраціями, а не бенчмарками.

Ключові висновки

  • OM-1 навчається лише на людських демонстраціях із носимої рукавички із 7 ступенями свободи; дані телеоперації або роботів не використовуються.
  • Електромагнітне відстеження скоротило середню похибку перерегулювання на 60% за швидкості 67 см/с порівняно з візуально-інерційним (9,5 мм проти 24,9 мм).
  • Кожен потік даних сенсора зберігає власну частоту; рівень керування RL працює у власному такті.
  • За даними Reward AI, нове завдання опановується менш ніж за 30 хвилин даних.

Ознайомтеся з технічними деталями тут. Усі заслуги належать досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабреддіту про машинне навчання з понад 150 тисячами учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.

Потрібна співпраця з нами для просування вашого репозиторію GitHub, сторінки Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини