Reka представи Rho-1: 19B омни-модел за разсъждение, която разбира и генерира видео и извежда действия за роботи в един модел
Reka публикува изследователска предварителна версия на Rho-1 — омни-модел за разсъждение с 19 млрд. параметъра, обучен от нулата. Една невронна мрежа разбира и генерира текст, изображения и видео, разсъждава върху тях и извежда действия на роботи. Reka го представя като директен заместител на агентните конвейери, които предават задачи между модели, специализирани в отделни модалности.
Какво променя Rho-1
Повечето мултимодални системи днес са конвейери. Централен модел планира, а след това възлага задачи на специалисти за изображения, видео или детекция. Всяко предаване добавя латентност, а всеки специалист вижда само ограничена заявка.
Rho-1 премахва тези предавания. Текстът, зрението и роботизираните действия се превръщат в токени в рамките на един контекстен прозорец. Според изследването на Reka една нередактирана сесия показва целия цикъл. Моделът рисува фар, огражда го в рамка, анимира го, редактира видеото в снежна буря и обяснява разликата. Всичко това се случва в 5 хода, без извикване на инструмент и без втори модел.
Архитектура: два потока, един KV кеш
Всеки вход и изход използва един от два нативни формата:
- Дискретните токени пренасят текст, символно разсъждение и команди от високо ниво.
- Непрекъснатите токени пренасят латентни представяния на изображения, видео кадри, роботизирани действия и проприоцепция.
Всеки трансформаторен блок съдържа два потока от експертни тегла. Потокът за разбиране обработва езика и визуалния анализ. Потокът за генериране обезшумява латентните представяния до изображения и видео. Двата потока споделят механизма за внимание и работят върху един и същ KV кеш.
Когато отговорът изисква пиксели, потокът за разбиране извежда дискретен токен за предаване. След това потокът за генериране визуализира съдържанието от цялото натрупано състояние. Обучението комбинира предсказване на следващия токен за дискретни последователности с flow matching за непрекъснати изходи.
Този дизайн има практически последствия. Ограждащите рамки се извеждат като координатни токени, а не от отделен детектор. Първият кадър на видеото използва повторно представянето на изображението в контекста, вместо да бъде повторно кодиран екземпляр.
Скорост: базов срещу дистилиран модел
Базовият модел генерира видео с 0,79x скорост в реално време (медиана), като гледаем поток започва приблизително след 6 секунди. Екипът на Reka измерва 7,0 секунди до първия клип спрямо илюстративните 13,8 секунди при многоагентен конвейер.
Дистилираният вариант намалява обезшумяването от 99 на 8 стъпки, при отчетена минимална загуба на качество. Той връща клип с продължителност 5,3 секунди за около секунда. При вътрешните тестове на Reka той се изравнява с най-бързите специализирани модели за изображения. Освен това е най-бързият тестван модел до първия текстов токен. Това са тестове, проведени от доставчика, а не независими бенчмаркове.
Световен модел и роботика
Rho-1 предава поток непрекъснато, клип след клип. Новите инструкции постъпват през потока за разбиране и актуализират състоянието по време на изпълнението. Reka демонстрира едно начало, разклонено в продължения „завой наляво“ и „завой надясно“.
При роботиката действията и бъдещите кадри се декодират от едно и също латентно състояние. Симулационен епизод от LIBERO показва как Rho-1 извежда 7 канала за действия. За да преодолее недостига на записи от телеоперация, Reka комбинира Rho-1 със своя модел на обратната динамика, който извежда управляващи сигнали от необработено видео.
Как се сравнява Rho-1
Данните са проверени на 5 октомври 2026 г. от официални източници.
| Функция | Reka Rho-1 | ByteDance BAGEL | BAAI Emu3.5 | Google Genie 3 |
|---|---|---|---|---|
| Разработчик | Reka | ByteDance Seed | BAAI | Google DeepMind |
| Параметри | 19B | 14B общо, 7B активни (MoT) | 34B | Не е обявено |
| Входове | Текст, изображение, видео, действия, проприоцепция | Текст, изображение | Редуващи се текст и изображение | Текстова подкана, навигационни входове |
| Изходи | Текст, изображение, видео, действия, проприоцепция | Текст, изображение | Редуващи се текст и изображение | Интерактивен видео свят |
| Нативно генериране на видео | Да, ограничено до 672×384 | Не | Не (кадри на изображения, а не нативни клипове) | Да, 720p при 24 кадъра в секунда |
| Управление в реално време | Да, непрекъснато изпълнение | Не | Не | Да, задаваеми чрез подкана събития в света |
| Роботизирани действия | Нативни непрекъснати токени за действия | Не | Демонстрации на въплътена манипулация | Приема навигационни действия, но не ги извежда |
| Публично достъпни тегла | Не | Да, Apache 2.0 | Да, Apache 2.0 | Не |
| Достъп днес | Изследователска предварителна версия чрез contact@reka.ai | Hugging Face, GitHub | Hugging Face, приложението emu.world | Project Genie за абонати на Google AI Ultra |
| Източник/Ресурси | Блогът на Reka | GitHub | Hugging Face | Блогът на DeepMind |
Достъпът до Genie 3 е според Project Genie; броят параметри на Emu3.5 е според картата на модела му в Hugging Face.
Основни изводи
- Rho-1 е модел с 19B параметъра, който чете и записва текст, изображения, видео и роботизирани действия.
- Два експертни потока споделят механизма за внимание и един KV кеш във всеки блок.
- Дистилацията намалява обезшумяването от 99 на 8 стъпки — около 1 секунда за клип от 5,3 секунди.
- Обучен е върху 320 H100 за 3 месеца; видеото е ограничено до 672×384.
- Само изследователска предварителна версия: все още няма публични тегла, API или цени.
Разгледайте техническите подробности и съобщението в X. Цялата заслуга е за изследователя на този проект. Също така, не се колебайте да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit за машинно обучение с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Сега можете да се присъедините към нас и в Telegram.
Имате нужда от партньор за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face ИЛИ издание на продукт ИЛИ уебинар и т.н.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.