Generalist AI представила GEN-1.5: базову модель для роботів, яка навчається нових завдань за однією демонстрацією тривалістю 3–12 секунд
Generalist AI випустила GEN-1.5 — базову модель для роботів, яка навчається новому фізичному завданню за однією демонстрацією. Завантажте від 3 до 12 секунд сенсомоторних даних у її 30-секундне контекстне вікно — і робот виконає завдання. Без оновлення градієнтів, без донавчання, без програмування під конкретне завдання. У 10 різноманітних завданнях маніпуляції це однокрокове контекстне промптування в середньому дало 59% успішних виконань (±10% стандартного відхилення) безпосередньо з попередньо навченої моделі. Десять градієнтних кроків на п’яти хвилинах даних для кожного завдання підвищили цей показник до 83% (±9%). Generalist називає цей механізм фізичним промптуванням і стверджує, що модель не навчали для цього спеціально: без архітектурних змін, без циклу метанавчання, без допоміжних цілей. Ця здатність виникла після понад восьми місяців безперервного попереднього навчання на даних про фізичну взаємодію. Завдання прості й мають короткий горизонт планування, і компанія прямо це визнає. Але це перша відома команді модель, у якій однокрокове навчання фізичних навичок виникло в масштабі.
Чи готова вона до впровадження?
Ще ні — це дослідницький реліз. Немає публічних ваг, API, сторінки з цінами чи продукту для самостійного використання. Generalist AI запускає GEN-1.5 на власному парку роботів і власному рушії даних. Наразі отримати доступ до неї можна лише через пряму співпрацю.
Що таке GEN-1.5?
GEN-1.5 — це велика мультимодальна модель, яка отримує відео-, сенсорні, мовні та пропріоцептивні дані, зберігає 30 секунд пам’яті й генерує траєкторії дій із частотою 100 Гц. Вона безперервно попередньо навчалася понад вісім місяців на даних про фізичну взаємодію, зібраних у будинках, на складах і фабриках.
Основним механізмом є фізичне промптування. Сенсомоторний приклад — потоки сенсорних даних разом із траєкторією дій — вставляється в 30-секундне контекстне вікно через інтерфейс перетягування. Решту вікна займають поточні спостереження. Після цього модель одразу виконує завдання — без жодного градієнтного кроку та без донавчання.
Важливо, що нічого з цього не було закладено в модель спочатку. Generalist зазначає, що не було жодних архітектурних змін для сприяння контекстному навчанню, жодного циклу метанавчання і жодних допоміжних цілей, які заохочували б імпровізацію. Ця здатність виникла завдяки масштабу попереднього навчання — так само, як однокрокове промптування виникло в GPT-3.
Цифри
У 10 різноманітних завданнях однокрокове контекстне промптування в середньому дало 59% успішних виконань (±10% стандартного відхилення) на попередньо навченій моделі, без будь-якого навчання. Десять градієнтних кроків на п’яти хвилинах даних для кожного завдання — приблизно 50 демонстрацій — підвищили цей показник до 83% (±9%). В екстремальному випадку один градієнтний крок на одній хвилині даних дав результат 66,5% на завданні, відкладеному для тестування, без підбору гіперпараметрів, специфічних для адаптації.
Найцікавішою є історія з обчислювальними ресурсами. Адаптація роботизованих політик зазвичай потребувала десятків тисяч градієнтних кроків. Тут десять кроків змінюють ваги моделі на відкладених завданнях менш ніж на 0,15%, що свідчить: донавчання радше переналаштовує вже наявні в моделі знання, ніж формує нові представлення. Generalist описує це як навчання під час тестування в умовах надзвичайно малого обсягу даних.
Три важливі результати перенесення
- Композиційна генералізація: Дві незалежно записані підказки, розміщені в контексті, об’єднуються в одну безперервну поведінку. Модель генерує проміжні рухи — зміну положення, повторне захоплення, відновлення після помилок, — яких немає в жодній із демонстрацій.
- Перенесення із симуляції в реальність без прикладів: Демонстрація, повністю записана в симуляції, працює як підказка для реального робота, хоча в даних попереднього навчання не було жодних симуляцій — ні відрендереного відео, ні змодельованої динаміки. Для деяких завдань демонстрації більше не потрібно збирати фізично.
- Імітація людиною робота: У деяких випадках людина демонструє дію власними руками в полі зору камер робота, а модель відтворює її руками робота.
Генералізація також проявляється після легкого донавчання. Навчена за п’ятьма хвилинами прибирання блока щіткою в миску, модель використала банан як імпровізовану щітку, а також скористалася совком для піднімання й висипання блока — зовсім іншою послідовністю контактів. Вона також прибрала аркуш паперу, що накривав миску, і працювала обома руками, коли в демонстраціях використовувалася одна рука.
Інтерактивне пояснення
Основні висновки
- GEN-1.5 навчається нових завдань маніпуляції за однією демонстрацією тривалістю від 3 до 12 секунд, доданою до її 30-секундного контекстного вікна.
- Однокрокове контекстне промптування досягло 59% у 10 завданнях; 10 градієнтних кроків на 5 хвилинах даних — 83%.
- Однокрокове навчання, перенесення із симуляції в реальність і перенесення від людини до робота виникли завдяки попередньому навчанню — модель не навчали для цього спеціально.
- Десять градієнтних кроків змінюють ваги менш ніж на 0,15%, скорочуючи обчислювальні витрати на адаптацію до окремого завдання на порядки.
- Немає ваг, API чи продукту: сприймайте це як дослідницький сигнал про масштабування, а не як систему, готову до впровадження.
Ознайомтеся з дослідницькою публікацією про GEN-1.5 та тредом із заявою @GeneralistAI. Також перегляньте нашу сторінку GitHub із навчальними матеріалами, кодом і блокнотами.
Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого ML SubReddit із понад 150 тисячами учасників та підписатися на нашу розсилку. Стривайте! Ви користуєтеся Telegram? Тепер ви також можете приєднатися до нас у Telegram.
Потрібна співпраця з нами для просування вашого репозиторію GitHub, сторінки Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.