Generalist AI выпустила GEN-1.5: базовую модель для роботов, которая обучается новым задачам по одной демонстрации длительностью 3–12 секунд
Generalist AI выпустила GEN-1.5 — фундаментальную модель для роботов, которая обучается новой физической задаче по одной демонстрации. Загрузите в её 30-секундное контекстное окно 3–12 секунд сенсомоторных данных — и робот выполнит задачу. Без обновления градиентов, дообучения и программирования под конкретную задачу. На 10 разнообразных задачах манипуляции такое однократное контекстное промптирование показало в среднем 59% успешных выполнений (±10% стандартного отклонения) непосредственно на предварительно обученной модели. Десять шагов по градиенту на пяти минутах данных для каждой задачи повысили этот показатель до 83% (±9%). Generalist называет этот механизм физическим промптированием и заявляет, что модель никогда специально для него не обучалась: не было ни архитектурных изменений, ни цикла метаобучения, ни вспомогательных целевых функций. Он возник в результате более восьми месяцев непрерывного предварительного обучения на данных о физических взаимодействиях. Задачи простые и рассчитаны на короткий горизонт, и компания прямо об этом говорит. Но это первая известная команде модель, в которой однократное обучение физическим навыкам возникло в таком масштабе.
Можно ли её внедрять?
Пока нет — это исследовательский релиз. Публичных весов, API, страницы с ценами и продукта для самостоятельного использования нет. Generalist AI запускает GEN-1.5 на собственной флотилии роботов и собственном движке данных. Желающим использовать её сегодня необходимо заключить прямое партнёрство.
Что такое GEN-1.5?
GEN-1.5 — это большая мультимодальная модель, принимающая видео, сенсорные, языковые и проприоцептивные данные, сохраняющая 30 секунд памяти и выдающая траектории действий с частотой 100 Гц. Она непрерывно предварительно обучалась более восьми месяцев на данных о физических взаимодействиях, собранных в домах, на складах и фабриках.
Основной механизм — физическое промптирование. Сенсомоторный пример — потоки сенсорных данных вместе с траекторией действий — вставляется в 30-секундное контекстное окно через интерфейс перетаскивания. Остальную часть окна занимают последовательно поступающие наблюдения. Затем модель немедленно выполняет задачу — без единого шага по градиенту и без дообучения.
Важно, что всё это не было заложено в модель изначально. Generalist заявляет, что не было ни архитектурных изменений для поддержки контекстного обучения, ни цикла метаобучения, ни вспомогательных целевых функций, стимулирующих импровизацию. Эта способность возникла благодаря масштабу предварительного обучения — так же, как однократное промптирование возникло в GPT-3.
Цифры
На 10 разнообразных задачах однократное контекстное промптирование показало в среднем 59% успешных выполнений (±10% стандартного отклонения) на предварительно обученной модели, без какого-либо обучения. Десять шагов по градиенту на пяти минутах данных для каждой задачи — примерно 50 демонстраций — повысили этот показатель до 83% (±9%). В экстремальном случае один шаг по градиенту на одной минуте данных дал результат 66,5% на отложенной задаче — без подбора гиперпараметров, специфичных для адаптации.
Самое интересное здесь — вычислительная сторона. Адаптация политик роботов обычно требовала десятков тысяч шагов по градиенту. В данном случае десять шагов изменяют веса модели на отложенных задачах менее чем на 0,15%, что указывает: дообучение скорее перестраивает уже имеющиеся у модели знания, чем создаёт новые представления. Generalist описывает это как обучение во время тестирования в условиях чрезвычайно малого объёма данных.
Три важных результата переноса
- Композиционная генерализация: Две независимо записанные подсказки, помещённые в контекст, объединяются в одно непрерывное поведение. Модель создаёт связующие движения — перемещение, повторный захват и восстановление после ошибок, — которых нет ни в одной из демонстраций.
- Перенос из симуляции в реальность без примеров: Демонстрация, полностью записанная в симуляции, работает как подсказка для реального робота, несмотря на отсутствие в предварительном обучении данных симуляции — ни визуализированного видео, ни смоделированной динамики. Для некоторых задач демонстрации больше не нужно собирать физически.
- Имитация действий человека роботом: В некоторых случаях человек демонстрирует действие собственными руками в поле зрения камер робота, а модель воспроизводит его руками робота.
Генерализация проявляется и после лёгкого дообучения. Обученная на пяти минутах данных о том, как щёткой сдвигать кубик в миску, модель использовала банан вместо щётки, а также совок, чтобы поднять и высыпать кубик, — задействуя совершенно другую последовательность контактов. Она также убрала лист бумаги, закрывавший миску, и работала обеими руками, когда в демонстрациях использовалась одна рука.
Интерактивное объяснение
Ключевые выводы
- GEN-1.5 обучается новым задачам манипуляции по одной демонстрации длительностью 3–12 секунд, загруженной в её 30-секундное контекстное окно.
- Однократное контекстное промптирование достигло 59% на 10 задачах; 10 шагов по градиенту на 5 минутах данных — 83%.
- Однократное обучение, перенос из симуляции в реальность и имитация человеком роботом возникли в процессе предварительного обучения — модель явно ни для чего из этого не обучали.
- Десять шагов по градиенту изменяют веса менее чем на 0,15%, сокращая вычислительные затраты на адаптацию к каждой задаче на порядки.
- Нет весов, нет API, нет продукта: воспринимайте это как исследовательский сигнал о масштабировании, а не как готовую к внедрению систему.
Ознакомьтесь с исследовательской публикацией о GEN-1.5 и веткой объявления @GeneralistAI. Также посетите нашу страницу GitHub с руководствами, кодом и ноутбуками.
Также подпишитесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы пользуетесь Telegram? Теперь к нам можно присоединиться и в Telegram.
Хотите сотрудничать с нами для продвижения вашего репозитория GitHub, страницы Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.