Sakhanda Wire
NVDA $209.68 -2.35% MSFT $489.01 +1.19% GOOGL $351.00 +1.79% META $557.86 +1.45% AMZN $262.99 +1.68%
← Към новините

Generalist AI представи GEN-1.5: фундаментален модел за роботи, който усвоява нови задачи от една демонстрация с продължителност 3–12 секунди

Generalist AI представи GEN-1.5 — базов модел за роботи, който научава нова физическа задача от една-единствена демонстрация. Подайте 3–12 секунди сензомоторни данни в неговия 30-секунден контекстов прозорец и роботът изпълнява задачата. Без актуализации на градиента, без дообучаване и без програмиране, специфично за задачата. При 10 разнообразни задачи за манипулация това еднократно подканване в контекста постига средно 59% успеваемост (±10% стандартно отклонение) директно от предварително обучения модел. Десет градиентни стъпки върху пет минути данни за всяка задача повишават резултата до 83% (±9%). Generalist нарича механизма физическо подканване и заявява, че моделът никога не е бил обучаван за това: няма архитектурни промени, няма цикъл на метаобучение и няма спомагателни цели. Способността се е появила след над осем месеца непрекъснато предварително обучение върху данни от физически взаимодействия. Задачите са прости и с кратък хоризонт, което компанията заявява ясно. Но това е първият модел, за който екипът ѝ знае, при който еднократното обучение на физически умения се е появило в голям мащаб.

Готов ли е за внедряване?

Все още не — това е изследователска версия. Няма публични тегла, API, страница с цени или продукт за самостоятелно използване. Generalist AI изпълнява GEN-1.5 върху собствен парк от роботи и собствена система за данни. Всеки, който иска да го използва днес, трябва да сключи пряко партньорство.

Какво представлява GEN-1.5?

GEN-1.5 е голям мултимодален модел, който приема видео, сензорни, езикови и проприоцептивни входове, съхранява 30 секунди памет и генерира траектории на действията с честота 100 Hz. Той е бил предварително обучаван непрекъснато в продължение на над осем месеца върху данни от физически взаимодействия, заснети в домове, складове и фабрики.

Основният механизъм е физическото подканване. Сензомоторен пример — сензорни потоци плюс траекторията на действията — се вмъква в 30-секундния контекстов прозорец чрез интерфейс с плъзгане и пускане. Останалата част от прозореца съдържа текущи наблюдения. След това моделът изпълнява задачата незабавно, без нито една градиентна стъпка и без дообучаване.

От решаващо значение е, че нищо от това не е било предварително проектирано. Generalist заявява, че не са правени архитектурни промени за насърчаване на обучението в контекста, няма цикъл на метаобучение и няма спомагателни цели, насърчаващи импровизацията. Способността се е появила благодарение на мащаба на предварителното обучение — по същия начин, по който еднократното подканване се е появило в GPT-3.

Числата

При 10 разнообразни задачи еднократното подканване в контекста постига средно 59% успеваемост (±10% стандартно отклонение) от предварително обучения модел, без никакво обучение. Десет градиентни стъпки върху пет минути данни за всяка задача — приблизително 50 демонстрации — повишават резултата до 83% (±9%). В екстремния случай една градиентна стъпка върху една минута данни достига 66,5% при задача, изключена от обучението, без търсене на хиперпараметри, специфични за адаптацията.

Най-интересната част е свързана с изчислителните ресурси. Адаптирането на политики за роботи обикновено изисква десетки хиляди градиентни стъпки. Тук десет стъпки променят теглата на модела при задачи, изключени от обучението, с по-малко от 0,15%, което подсказва, че дообучаването преконфигурира вече налични в модела знания, вместо да изгражда нови представяния. Generalist представя това като обучение по време на тестване в режим с изключително малко данни.

Три важни резултата от преноса

  • Композиционна генерализация: Две независимо записани подканвания, поставени в контекста, се свързват в едно непрекъснато поведение. Моделът генерира свързващите движения — препозициониране, повторно захващане и възстановяване от грешки — които не присъстват в нито една от демонстрациите.
  • Пренос от симулация към реалност без допълнително обучение: Демонстрация, записана изцяло в симулация, работи като подканване за реалния робот, въпреки че предварителното обучение не съдържа симулационни данни — нито рендерирано видео, нито симулирана динамика. При някои задачи демонстрациите вече не е необходимо да се събират физически.
  • Имитация от човек към робот: В някои случаи човек демонстрира със собствените си ръце пред камерите на робота, а моделът възпроизвежда демонстрацията с ръцете на робота.

Генерализация се наблюдава и след леко дообучаване. Обучен в продължение на пет минути да избутва блок в купа с четка, моделът използва банан като импровизирана четка и вместо това използва лопатка за прах, за да повдигне и изсипе блока — изцяло различна последователност на контактите. Той също така отстранява лист хартия, покриващ купата, и работи амбидекстрално, когато демонстрациите са направени с една ръка.

Интерактивно обяснение

Основни изводи

  • GEN-1.5 научава нови задачи за манипулация от една-единствена демонстрация с продължителност 3–12 секунди, подадена в неговия 30-секунден контекстов прозорец.
  • Еднократното подканване в контекста достига 59% при 10 задачи; 10 градиентни стъпки върху 5 минути данни достигат 83%.
  • Еднократният пренос, преносът от симулация към реалност и преносът от човек към робот са се появили в резултат на предварителното обучение — нищо от това не е било изрично обучавано.
  • Десет градиентни стъпки променят теглата с по-малко от 0,15%, намалявайки изчислителните разходи за адаптация към отделна задача с порядъци.
  • Няма тегла, няма API, няма продукт: разглеждайте това като изследователски сигнал за мащабирането, а не като система, готова за внедряване.

Вижте изследователската публикация за GEN-1.5 и нишката с обявлението на @GeneralistAI. Разгледайте и нашата GitHub страница с уроци, код и ноутбуци.

Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.

Искате да си партнирате с нас за популяризирането на вашето GitHub хранилище ИЛИ Hugging Face страница ИЛИ представяне на продукт ИЛИ уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини