Sakhanda Wire
NVDA $209.68 -2.35% MSFT $489.01 +1.19% GOOGL $351.00 +1.79% META $557.86 +1.45% AMZN $262.99 +1.68%
← До новин

Generalist AI представила GEN-1.5: базову модель для роботів, яка навчається нових завдань за однією демонстрацією тривалістю 3–12 секунд

Generalist AI випустила GEN-1.5 — базову модель для роботів, яка навчається новому фізичному завданню за однією демонстрацією. Завантажте від 3 до 12 секунд сенсомоторних даних у її 30-секундне контекстне вікно — і робот виконає завдання. Без оновлення градієнтів, без донавчання, без програмування під конкретне завдання. У 10 різноманітних завданнях маніпуляції це однокрокове контекстне промптування в середньому дало 59% успішних виконань (±10% стандартного відхилення) безпосередньо з попередньо навченої моделі. Десять градієнтних кроків на п’яти хвилинах даних для кожного завдання підвищили цей показник до 83% (±9%). Generalist називає цей механізм фізичним промптуванням і стверджує, що модель не навчали для цього спеціально: без архітектурних змін, без циклу метанавчання, без допоміжних цілей. Ця здатність виникла після понад восьми місяців безперервного попереднього навчання на даних про фізичну взаємодію. Завдання прості й мають короткий горизонт планування, і компанія прямо це визнає. Але це перша відома команді модель, у якій однокрокове навчання фізичних навичок виникло в масштабі.

Чи готова вона до впровадження?

Ще ні — це дослідницький реліз. Немає публічних ваг, API, сторінки з цінами чи продукту для самостійного використання. Generalist AI запускає GEN-1.5 на власному парку роботів і власному рушії даних. Наразі отримати доступ до неї можна лише через пряму співпрацю.

Що таке GEN-1.5?

GEN-1.5 — це велика мультимодальна модель, яка отримує відео-, сенсорні, мовні та пропріоцептивні дані, зберігає 30 секунд пам’яті й генерує траєкторії дій із частотою 100 Гц. Вона безперервно попередньо навчалася понад вісім місяців на даних про фізичну взаємодію, зібраних у будинках, на складах і фабриках.

Основним механізмом є фізичне промптування. Сенсомоторний приклад — потоки сенсорних даних разом із траєкторією дій — вставляється в 30-секундне контекстне вікно через інтерфейс перетягування. Решту вікна займають поточні спостереження. Після цього модель одразу виконує завдання — без жодного градієнтного кроку та без донавчання.

Важливо, що нічого з цього не було закладено в модель спочатку. Generalist зазначає, що не було жодних архітектурних змін для сприяння контекстному навчанню, жодного циклу метанавчання і жодних допоміжних цілей, які заохочували б імпровізацію. Ця здатність виникла завдяки масштабу попереднього навчання — так само, як однокрокове промптування виникло в GPT-3.

Цифри

У 10 різноманітних завданнях однокрокове контекстне промптування в середньому дало 59% успішних виконань (±10% стандартного відхилення) на попередньо навченій моделі, без будь-якого навчання. Десять градієнтних кроків на п’яти хвилинах даних для кожного завдання — приблизно 50 демонстрацій — підвищили цей показник до 83% (±9%). В екстремальному випадку один градієнтний крок на одній хвилині даних дав результат 66,5% на завданні, відкладеному для тестування, без підбору гіперпараметрів, специфічних для адаптації.

Найцікавішою є історія з обчислювальними ресурсами. Адаптація роботизованих політик зазвичай потребувала десятків тисяч градієнтних кроків. Тут десять кроків змінюють ваги моделі на відкладених завданнях менш ніж на 0,15%, що свідчить: донавчання радше переналаштовує вже наявні в моделі знання, ніж формує нові представлення. Generalist описує це як навчання під час тестування в умовах надзвичайно малого обсягу даних.

Три важливі результати перенесення

  • Композиційна генералізація: Дві незалежно записані підказки, розміщені в контексті, об’єднуються в одну безперервну поведінку. Модель генерує проміжні рухи — зміну положення, повторне захоплення, відновлення після помилок, — яких немає в жодній із демонстрацій.
  • Перенесення із симуляції в реальність без прикладів: Демонстрація, повністю записана в симуляції, працює як підказка для реального робота, хоча в даних попереднього навчання не було жодних симуляцій — ні відрендереного відео, ні змодельованої динаміки. Для деяких завдань демонстрації більше не потрібно збирати фізично.
  • Імітація людиною робота: У деяких випадках людина демонструє дію власними руками в полі зору камер робота, а модель відтворює її руками робота.

Генералізація також проявляється після легкого донавчання. Навчена за п’ятьма хвилинами прибирання блока щіткою в миску, модель використала банан як імпровізовану щітку, а також скористалася совком для піднімання й висипання блока — зовсім іншою послідовністю контактів. Вона також прибрала аркуш паперу, що накривав миску, і працювала обома руками, коли в демонстраціях використовувалася одна рука.

Інтерактивне пояснення

Основні висновки

  • GEN-1.5 навчається нових завдань маніпуляції за однією демонстрацією тривалістю від 3 до 12 секунд, доданою до її 30-секундного контекстного вікна.
  • Однокрокове контекстне промптування досягло 59% у 10 завданнях; 10 градієнтних кроків на 5 хвилинах даних — 83%.
  • Однокрокове навчання, перенесення із симуляції в реальність і перенесення від людини до робота виникли завдяки попередньому навчанню — модель не навчали для цього спеціально.
  • Десять градієнтних кроків змінюють ваги менш ніж на 0,15%, скорочуючи обчислювальні витрати на адаптацію до окремого завдання на порядки.
  • Немає ваг, API чи продукту: сприймайте це як дослідницький сигнал про масштабування, а не як систему, готову до впровадження.

Ознайомтеся з дослідницькою публікацією про GEN-1.5 та тредом із заявою @GeneralistAI. Також перегляньте нашу сторінку GitHub із навчальними матеріалами, кодом і блокнотами.

Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого ML SubReddit із понад 150 тисячами учасників та підписатися на нашу розсилку. Стривайте! Ви користуєтеся Telegram? Тепер ви також можете приєднатися до нас у Telegram.

Потрібна співпраця з нами для просування вашого репозиторію GitHub, сторінки Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини