Reka выпустила Rho-1: омни-модель рассуждения на 19B параметров, которая понимает и генерирует видео и выдает действия для роботов в одной системе
Reka выпустила исследовательскую предварительную версию Rho-1 — мультимодальной модели с 19 млрд параметров, обученной с нуля. Одна нейросеть понимает и генерирует текст, изображения и видео, рассуждает над ними и выдает действия для роботов. Reka позиционирует ее как прямую замену агентным конвейерам, передающим задачи между моделями, специализирующимися на отдельных модальностях.
Что меняет Rho-1
Большинство современных мультимодальных систем представляют собой конвейеры. Центральная модель планирует, а затем передает задачи специалистам по изображениям, видео или обнаружению объектов. Каждая передача увеличивает задержку, а каждый специалист видит только узкий запрос.
Rho-1 устраняет эти передачи. Текст, визуальные данные и действия робота становятся токенами внутри одного контекстного окна. Согласно исследованию Reka, одна необработанная сессия демонстрирует полный цикл. Модель рисует маяк, выделяет его рамкой, анимирует, редактирует видео, превращая его в снежную бурю, и объясняет различия. Все это происходит за 5 ходов, без вызова инструментов и без второй модели.
Архитектура: два потока, один KV-кэш
Каждый вход и выход использует один из двух нативных форматов:
- Дискретные токены переносят текст, символьные рассуждения и высокоуровневые команды.
- Непрерывные токены переносят латентные представления изображений, кадры видео, действия робота и проприоцепцию.
Каждый блок трансформера содержит два потока экспертных весов. Поток понимания обрабатывает язык и визуальный анализ. Поток генерации очищает латентные представления, превращая их в изображения и видео. Оба потока используют общее внимание и работают с одним и тем же KV-кэшем.
Когда ответу нужны пиксели, поток понимания выдает дискретный токен передачи. Затем поток генерации рендерит результат на основе всего накопленного состояния. Обучение сочетает предсказание следующего токена для дискретных последовательностей с сопоставлением потоков для непрерывных выходных данных.
Такая конструкция имеет практические последствия. Ограничивающие рамки выдаются в виде токенов координат, а не отдельным детектором. Первый кадр видео использует представление изображения из контекста, вместо того чтобы кодироваться повторно.
Скорость: базовая и дистиллированная версии
Базовая модель генерирует видео со скоростью 0,79x в реальном времени (медианное значение), причем пригодный для просмотра поток начинается примерно через 6 секунд. Команда Reka измерила 7,0 секунды до получения первого клипа против показателя 13,8 секунды для иллюстративного многоагентного конвейера.
Дистиллированная версия сокращает число шагов очистки с 99 до 8 при минимальной заявленной потере качества. Она создала клип длительностью 5,3 секунды примерно за одну секунду. Во внутренних тестах Reka она сравнялась с самыми быстрыми специализированными моделями для изображений. Она также оказалась самой быстрой из протестированных моделей по времени до появления первого текстового токена. Это тесты, проведенные поставщиком, а не независимые бенчмарки.
Мировая модель и робототехника
Rho-1 работает непрерывно, создавая клип за клипом. Новые инструкции поступают через поток понимания и обновляют состояние в процессе генерации. Reka демонстрирует один начальный фрагмент, разветвляющийся на продолжения «повернуть налево» и «повернуть направо».
В робототехнике действия и будущие кадры декодируются из одного и того же латентного состояния. Эпизод симуляции LIBERO показывает, как Rho-1 выдает 7 каналов действий. Чтобы масштабироваться за пределы ограниченного количества журналов телеуправления, Reka объединяет Rho-1 со своей моделью обратной динамики, которая выводит управляющие сигналы из необработанного видео.
Сравнение Rho-1
Данные проверены 5 октября 2026 года по официальным источникам.
| Характеристика | Reka Rho-1 | ByteDance BAGEL | BAAI Emu3.5 | Google Genie 3 |
|---|---|---|---|---|
| Разработчик | Reka | ByteDance Seed | BAAI | Google DeepMind |
| Параметры | 19 млрд | 14 млрд всего, 7 млрд активных (MoT) | 34 млрд | Не раскрыто |
| Входные данные | Текст, изображения, видео, действия, проприоцепция | Текст, изображения | Чередующиеся текст и изображения | Текстовый запрос, навигационные входные данные |
| Выходные данные | Текст, изображения, видео, действия, проприоцепция | Текст, изображения | Чередующиеся текст и изображения | Интерактивный видеомир |
| Нативная генерация видео | Да, ограничена разрешением 672×384 | Нет | Нет (кадры изображений, а не нативные клипы) | Да, 720p при 24 кадрах/с |
| Управление в реальном времени | Да, непрерывные развертывания | Нет | Нет | Да, задаваемые в запросе события мира |
| Действия робота | Нативные непрерывные токены действий | Нет | Демонстрации манипуляций воплощенного агента | Принимает навигационные действия, но не выдает их |
| Открытые веса | Нет | Да, Apache 2.0 | Да, Apache 2.0 | Нет |
| Доступ на данный момент | Исследовательская предварительная версия через contact@reka.ai | Hugging Face, GitHub | Hugging Face, приложение emu.world | Project Genie для подписчиков Google AI Ultra |
| Источник/Ресурсы | Блог Reka | GitHub | Hugging Face | Блог DeepMind |
Доступ к Genie 3 предоставляется согласно условиям Project Genie; количество параметров Emu3.5 указано в карточке модели на Hugging Face.
Основные выводы
- Rho-1 — это модель с 19 млрд параметров, которая читает и создает текст, изображения, видео и действия роботов.
- Два экспертных потока используют общее внимание и один KV-кэш в каждом блоке.
- Дистилляция сокращает число шагов очистки с 99 до 8 — примерно 1 секунда на клип длительностью 5,3 секунды.
- Модель обучалась на 320 H100 в течение 3 месяцев; видео ограничено разрешением 672×384.
- Только исследовательская предварительная версия: публичных весов, API и цен пока нет.
Ознакомьтесь с техническими подробностями и анонсом в X. Все заслуги принадлежат исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с аудиторией более 150 тысяч человек и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.
Хотите стать нашим партнером для продвижения вашего репозитория GitHub, страницы на Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.