Sakhanda Wire
NVDA $239.24 +0.14% MSFT $529.30 +0.78% GOOGL $347.68 +0.35% META $738.88 -0.41% AMZN $256.29 +1.95%
← Към новините

Reka представи Rho-1: 19B омни-модел за разсъждение, която разбира и генерира видео и извежда действия за роботи в един модел

Reka публикува изследователска предварителна версия на Rho-1 — омни-модел за разсъждение с 19 млрд. параметъра, обучен от нулата. Една невронна мрежа разбира и генерира текст, изображения и видео, разсъждава върху тях и извежда действия на роботи. Reka го представя като директен заместител на агентните конвейери, които предават задачи между модели, специализирани в отделни модалности.

Какво променя Rho-1

Повечето мултимодални системи днес са конвейери. Централен модел планира, а след това възлага задачи на специалисти за изображения, видео или детекция. Всяко предаване добавя латентност, а всеки специалист вижда само ограничена заявка.

Rho-1 премахва тези предавания. Текстът, зрението и роботизираните действия се превръщат в токени в рамките на един контекстен прозорец. Според изследването на Reka една нередактирана сесия показва целия цикъл. Моделът рисува фар, огражда го в рамка, анимира го, редактира видеото в снежна буря и обяснява разликата. Всичко това се случва в 5 хода, без извикване на инструмент и без втори модел.

Архитектура: два потока, един KV кеш

Всеки вход и изход използва един от два нативни формата:

  • Дискретните токени пренасят текст, символно разсъждение и команди от високо ниво.
  • Непрекъснатите токени пренасят латентни представяния на изображения, видео кадри, роботизирани действия и проприоцепция.

Всеки трансформаторен блок съдържа два потока от експертни тегла. Потокът за разбиране обработва езика и визуалния анализ. Потокът за генериране обезшумява латентните представяния до изображения и видео. Двата потока споделят механизма за внимание и работят върху един и същ KV кеш.

Когато отговорът изисква пиксели, потокът за разбиране извежда дискретен токен за предаване. След това потокът за генериране визуализира съдържанието от цялото натрупано състояние. Обучението комбинира предсказване на следващия токен за дискретни последователности с flow matching за непрекъснати изходи.

Този дизайн има практически последствия. Ограждащите рамки се извеждат като координатни токени, а не от отделен детектор. Първият кадър на видеото използва повторно представянето на изображението в контекста, вместо да бъде повторно кодиран екземпляр.

Скорост: базов срещу дистилиран модел

Базовият модел генерира видео с 0,79x скорост в реално време (медиана), като гледаем поток започва приблизително след 6 секунди. Екипът на Reka измерва 7,0 секунди до първия клип спрямо илюстративните 13,8 секунди при многоагентен конвейер.

Дистилираният вариант намалява обезшумяването от 99 на 8 стъпки, при отчетена минимална загуба на качество. Той връща клип с продължителност 5,3 секунди за около секунда. При вътрешните тестове на Reka той се изравнява с най-бързите специализирани модели за изображения. Освен това е най-бързият тестван модел до първия текстов токен. Това са тестове, проведени от доставчика, а не независими бенчмаркове.

Световен модел и роботика

Rho-1 предава поток непрекъснато, клип след клип. Новите инструкции постъпват през потока за разбиране и актуализират състоянието по време на изпълнението. Reka демонстрира едно начало, разклонено в продължения „завой наляво“ и „завой надясно“.

При роботиката действията и бъдещите кадри се декодират от едно и също латентно състояние. Симулационен епизод от LIBERO показва как Rho-1 извежда 7 канала за действия. За да преодолее недостига на записи от телеоперация, Reka комбинира Rho-1 със своя модел на обратната динамика, който извежда управляващи сигнали от необработено видео.

Как се сравнява Rho-1

Данните са проверени на 5 октомври 2026 г. от официални източници.

ФункцияReka Rho-1ByteDance BAGELBAAI Emu3.5Google Genie 3
РазработчикRekaByteDance SeedBAAIGoogle DeepMind
Параметри19B14B общо, 7B активни (MoT)34BНе е обявено
ВходовеТекст, изображение, видео, действия, проприоцепцияТекст, изображениеРедуващи се текст и изображениеТекстова подкана, навигационни входове
ИзходиТекст, изображение, видео, действия, проприоцепцияТекст, изображениеРедуващи се текст и изображениеИнтерактивен видео свят
Нативно генериране на видеоДа, ограничено до 672×384НеНе (кадри на изображения, а не нативни клипове)Да, 720p при 24 кадъра в секунда
Управление в реално времеДа, непрекъснато изпълнениеНеНеДа, задаваеми чрез подкана събития в света
Роботизирани действияНативни непрекъснати токени за действияНеДемонстрации на въплътена манипулацияПриема навигационни действия, но не ги извежда
Публично достъпни теглаНеДа, Apache 2.0Да, Apache 2.0Не
Достъп днесИзследователска предварителна версия чрез contact@reka.aiHugging Face, GitHubHugging Face, приложението emu.worldProject Genie за абонати на Google AI Ultra
Източник/РесурсиБлогът на RekaGitHubHugging FaceБлогът на DeepMind

Достъпът до Genie 3 е според Project Genie; броят параметри на Emu3.5 е според картата на модела му в Hugging Face.

Основни изводи

  • Rho-1 е модел с 19B параметъра, който чете и записва текст, изображения, видео и роботизирани действия.
  • Два експертни потока споделят механизма за внимание и един KV кеш във всеки блок.
  • Дистилацията намалява обезшумяването от 99 на 8 стъпки — около 1 секунда за клип от 5,3 секунди.
  • Обучен е върху 320 H100 за 3 месеца; видеото е ограничено до 672×384.
  • Само изследователска предварителна версия: все още няма публични тегла, API или цени.

Разгледайте техническите подробности и съобщението в X. Цялата заслуга е за изследователя на този проект. Също така, не се колебайте да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit за машинно обучение с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Сега можете да се присъедините към нас и в Telegram.

Имате нужда от партньор за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face ИЛИ издание на продукт ИЛИ уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини