Sakhanda Wire
NVDA $239.24 +0.14% MSFT $529.30 +0.78% GOOGL $347.68 +0.35% META $738.88 -0.41% AMZN $256.29 +1.95%
← К новостям

Reka выпустила Rho-1: омни-модель рассуждения на 19B параметров, которая понимает и генерирует видео и выдает действия для роботов в одной системе

Reka выпустила исследовательскую предварительную версию Rho-1 — мультимодальной модели с 19 млрд параметров, обученной с нуля. Одна нейросеть понимает и генерирует текст, изображения и видео, рассуждает над ними и выдает действия для роботов. Reka позиционирует ее как прямую замену агентным конвейерам, передающим задачи между моделями, специализирующимися на отдельных модальностях.

Что меняет Rho-1

Большинство современных мультимодальных систем представляют собой конвейеры. Центральная модель планирует, а затем передает задачи специалистам по изображениям, видео или обнаружению объектов. Каждая передача увеличивает задержку, а каждый специалист видит только узкий запрос.

Rho-1 устраняет эти передачи. Текст, визуальные данные и действия робота становятся токенами внутри одного контекстного окна. Согласно исследованию Reka, одна необработанная сессия демонстрирует полный цикл. Модель рисует маяк, выделяет его рамкой, анимирует, редактирует видео, превращая его в снежную бурю, и объясняет различия. Все это происходит за 5 ходов, без вызова инструментов и без второй модели.

Архитектура: два потока, один KV-кэш

Каждый вход и выход использует один из двух нативных форматов:

  • Дискретные токены переносят текст, символьные рассуждения и высокоуровневые команды.
  • Непрерывные токены переносят латентные представления изображений, кадры видео, действия робота и проприоцепцию.

Каждый блок трансформера содержит два потока экспертных весов. Поток понимания обрабатывает язык и визуальный анализ. Поток генерации очищает латентные представления, превращая их в изображения и видео. Оба потока используют общее внимание и работают с одним и тем же KV-кэшем.

Когда ответу нужны пиксели, поток понимания выдает дискретный токен передачи. Затем поток генерации рендерит результат на основе всего накопленного состояния. Обучение сочетает предсказание следующего токена для дискретных последовательностей с сопоставлением потоков для непрерывных выходных данных.

Такая конструкция имеет практические последствия. Ограничивающие рамки выдаются в виде токенов координат, а не отдельным детектором. Первый кадр видео использует представление изображения из контекста, вместо того чтобы кодироваться повторно.

Скорость: базовая и дистиллированная версии

Базовая модель генерирует видео со скоростью 0,79x в реальном времени (медианное значение), причем пригодный для просмотра поток начинается примерно через 6 секунд. Команда Reka измерила 7,0 секунды до получения первого клипа против показателя 13,8 секунды для иллюстративного многоагентного конвейера.

Дистиллированная версия сокращает число шагов очистки с 99 до 8 при минимальной заявленной потере качества. Она создала клип длительностью 5,3 секунды примерно за одну секунду. Во внутренних тестах Reka она сравнялась с самыми быстрыми специализированными моделями для изображений. Она также оказалась самой быстрой из протестированных моделей по времени до появления первого текстового токена. Это тесты, проведенные поставщиком, а не независимые бенчмарки.

Мировая модель и робототехника

Rho-1 работает непрерывно, создавая клип за клипом. Новые инструкции поступают через поток понимания и обновляют состояние в процессе генерации. Reka демонстрирует один начальный фрагмент, разветвляющийся на продолжения «повернуть налево» и «повернуть направо».

В робототехнике действия и будущие кадры декодируются из одного и того же латентного состояния. Эпизод симуляции LIBERO показывает, как Rho-1 выдает 7 каналов действий. Чтобы масштабироваться за пределы ограниченного количества журналов телеуправления, Reka объединяет Rho-1 со своей моделью обратной динамики, которая выводит управляющие сигналы из необработанного видео.

Сравнение Rho-1

Данные проверены 5 октября 2026 года по официальным источникам.

ХарактеристикаReka Rho-1ByteDance BAGELBAAI Emu3.5Google Genie 3
РазработчикRekaByteDance SeedBAAIGoogle DeepMind
Параметры19 млрд14 млрд всего, 7 млрд активных (MoT)34 млрдНе раскрыто
Входные данныеТекст, изображения, видео, действия, проприоцепцияТекст, изображенияЧередующиеся текст и изображенияТекстовый запрос, навигационные входные данные
Выходные данныеТекст, изображения, видео, действия, проприоцепцияТекст, изображенияЧередующиеся текст и изображенияИнтерактивный видеомир
Нативная генерация видеоДа, ограничена разрешением 672×384НетНет (кадры изображений, а не нативные клипы)Да, 720p при 24 кадрах/с
Управление в реальном времениДа, непрерывные развертыванияНетНетДа, задаваемые в запросе события мира
Действия роботаНативные непрерывные токены действийНетДемонстрации манипуляций воплощенного агентаПринимает навигационные действия, но не выдает их
Открытые весаНетДа, Apache 2.0Да, Apache 2.0Нет
Доступ на данный моментИсследовательская предварительная версия через contact@reka.aiHugging Face, GitHubHugging Face, приложение emu.worldProject Genie для подписчиков Google AI Ultra
Источник/РесурсыБлог RekaGitHubHugging FaceБлог DeepMind

Доступ к Genie 3 предоставляется согласно условиям Project Genie; количество параметров Emu3.5 указано в карточке модели на Hugging Face.

Основные выводы

  • Rho-1 — это модель с 19 млрд параметров, которая читает и создает текст, изображения, видео и действия роботов.
  • Два экспертных потока используют общее внимание и один KV-кэш в каждом блоке.
  • Дистилляция сокращает число шагов очистки с 99 до 8 — примерно 1 секунда на клип длительностью 5,3 секунды.
  • Модель обучалась на 320 H100 в течение 3 месяцев; видео ограничено разрешением 672×384.
  • Только исследовательская предварительная версия: публичных весов, API и цен пока нет.

Ознакомьтесь с техническими подробностями и анонсом в X. Все заслуги принадлежат исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с аудиторией более 150 тысяч человек и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.

Хотите стать нашим партнером для продвижения вашего репозитория GitHub, страницы на Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости