Sakhanda Wire
NVDA $209.68 -2.35% MSFT $489.01 +1.19% GOOGL $351.00 +1.79% META $557.86 +1.45% AMZN $262.99 +1.68%
← К новостям

Generalist AI выпустила GEN-1.5: базовую модель для роботов, которая обучается новым задачам по одной демонстрации длительностью 3–12 секунд

Generalist AI выпустила GEN-1.5 — фундаментальную модель для роботов, которая обучается новой физической задаче по одной демонстрации. Загрузите в её 30-секундное контекстное окно 3–12 секунд сенсомоторных данных — и робот выполнит задачу. Без обновления градиентов, дообучения и программирования под конкретную задачу. На 10 разнообразных задачах манипуляции такое однократное контекстное промптирование показало в среднем 59% успешных выполнений (±10% стандартного отклонения) непосредственно на предварительно обученной модели. Десять шагов по градиенту на пяти минутах данных для каждой задачи повысили этот показатель до 83% (±9%). Generalist называет этот механизм физическим промптированием и заявляет, что модель никогда специально для него не обучалась: не было ни архитектурных изменений, ни цикла метаобучения, ни вспомогательных целевых функций. Он возник в результате более восьми месяцев непрерывного предварительного обучения на данных о физических взаимодействиях. Задачи простые и рассчитаны на короткий горизонт, и компания прямо об этом говорит. Но это первая известная команде модель, в которой однократное обучение физическим навыкам возникло в таком масштабе.

Можно ли её внедрять?

Пока нет — это исследовательский релиз. Публичных весов, API, страницы с ценами и продукта для самостоятельного использования нет. Generalist AI запускает GEN-1.5 на собственной флотилии роботов и собственном движке данных. Желающим использовать её сегодня необходимо заключить прямое партнёрство.

Что такое GEN-1.5?

GEN-1.5 — это большая мультимодальная модель, принимающая видео, сенсорные, языковые и проприоцептивные данные, сохраняющая 30 секунд памяти и выдающая траектории действий с частотой 100 Гц. Она непрерывно предварительно обучалась более восьми месяцев на данных о физических взаимодействиях, собранных в домах, на складах и фабриках.

Основной механизм — физическое промптирование. Сенсомоторный пример — потоки сенсорных данных вместе с траекторией действий — вставляется в 30-секундное контекстное окно через интерфейс перетаскивания. Остальную часть окна занимают последовательно поступающие наблюдения. Затем модель немедленно выполняет задачу — без единого шага по градиенту и без дообучения.

Важно, что всё это не было заложено в модель изначально. Generalist заявляет, что не было ни архитектурных изменений для поддержки контекстного обучения, ни цикла метаобучения, ни вспомогательных целевых функций, стимулирующих импровизацию. Эта способность возникла благодаря масштабу предварительного обучения — так же, как однократное промптирование возникло в GPT-3.

Цифры

На 10 разнообразных задачах однократное контекстное промптирование показало в среднем 59% успешных выполнений (±10% стандартного отклонения) на предварительно обученной модели, без какого-либо обучения. Десять шагов по градиенту на пяти минутах данных для каждой задачи — примерно 50 демонстраций — повысили этот показатель до 83% (±9%). В экстремальном случае один шаг по градиенту на одной минуте данных дал результат 66,5% на отложенной задаче — без подбора гиперпараметров, специфичных для адаптации.

Самое интересное здесь — вычислительная сторона. Адаптация политик роботов обычно требовала десятков тысяч шагов по градиенту. В данном случае десять шагов изменяют веса модели на отложенных задачах менее чем на 0,15%, что указывает: дообучение скорее перестраивает уже имеющиеся у модели знания, чем создаёт новые представления. Generalist описывает это как обучение во время тестирования в условиях чрезвычайно малого объёма данных.

Три важных результата переноса

  • Композиционная генерализация: Две независимо записанные подсказки, помещённые в контекст, объединяются в одно непрерывное поведение. Модель создаёт связующие движения — перемещение, повторный захват и восстановление после ошибок, — которых нет ни в одной из демонстраций.
  • Перенос из симуляции в реальность без примеров: Демонстрация, полностью записанная в симуляции, работает как подсказка для реального робота, несмотря на отсутствие в предварительном обучении данных симуляции — ни визуализированного видео, ни смоделированной динамики. Для некоторых задач демонстрации больше не нужно собирать физически.
  • Имитация действий человека роботом: В некоторых случаях человек демонстрирует действие собственными руками в поле зрения камер робота, а модель воспроизводит его руками робота.

Генерализация проявляется и после лёгкого дообучения. Обученная на пяти минутах данных о том, как щёткой сдвигать кубик в миску, модель использовала банан вместо щётки, а также совок, чтобы поднять и высыпать кубик, — задействуя совершенно другую последовательность контактов. Она также убрала лист бумаги, закрывавший миску, и работала обеими руками, когда в демонстрациях использовалась одна рука.

Интерактивное объяснение

Ключевые выводы

  • GEN-1.5 обучается новым задачам манипуляции по одной демонстрации длительностью 3–12 секунд, загруженной в её 30-секундное контекстное окно.
  • Однократное контекстное промптирование достигло 59% на 10 задачах; 10 шагов по градиенту на 5 минутах данных — 83%.
  • Однократное обучение, перенос из симуляции в реальность и имитация человеком роботом возникли в процессе предварительного обучения — модель явно ни для чего из этого не обучали.
  • Десять шагов по градиенту изменяют веса менее чем на 0,15%, сокращая вычислительные затраты на адаптацию к каждой задаче на порядки.
  • Нет весов, нет API, нет продукта: воспринимайте это как исследовательский сигнал о масштабировании, а не как готовую к внедрению систему.

Ознакомьтесь с исследовательской публикацией о GEN-1.5 и веткой объявления @GeneralistAI. Также посетите нашу страницу GitHub с руководствами, кодом и ноутбуками.

Также подпишитесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы пользуетесь Telegram? Теперь к нам можно присоединиться и в Telegram.

Хотите сотрудничать с нами для продвижения вашего репозитория GitHub, страницы Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости