Sakhanda Wire
NVDA $239.24 +0.14% MSFT $529.30 +0.78% GOOGL $347.68 +0.35% META $738.88 -0.41% AMZN $256.29 +1.95%
← До новин

Reka представила Rho-1: омні-модель міркування на 19B параметрів, яка розуміє та генерує відео й видає дії для роботів в одній системі

Reka випустила дослідницьку попередню версію Rho-1 — омні-модель для міркувань із 19 млрд параметрів, навчену з нуля. Одна нейронна мережа розуміє та генерує текст, зображення й відео, міркує над ними та видає дії для роботів. Reka позиціонує її як пряму заміну агентним конвеєрам, які передають завдання між моделями, спеціалізованими на окремих модальностях.

Що змінює Rho-1

Більшість мультимодальних систем сьогодні є конвеєрами. Центральна модель планує, а потім передає завдання спеціалістам із роботи із зображеннями, відео чи виявленням об’єктів. Кожна передача додає затримку, а кожен спеціаліст бачить лише вузький запит.

Rho-1 усуває ці передачі. Текст, зображення та дії роботів стають токенами в одному контекстному вікні. Згідно з дослідженням Reka, одна невідредагована сесія демонструє весь цикл. Модель малює маяк, обводить його рамкою, анімує, редагує відео, перетворюючи його на заметіль, і пояснює різницю. Усе це відбувається за 5 ходів, без виклику інструментів і без другої моделі.

Архітектура: два потоки, один KV-кеш

Кожен вхід і вихід використовує один із двох нативних форматів:

  • Дискретні токени містять текст, символьні міркування та команди високого рівня.
  • Неперервні токени містять латентні представлення зображень, кадри відео, дії роботів і пропріоцепцію.

Кожен трансформерний блок містить два потоки експертних ваг. Потік розуміння обробляє мову та візуальний аналіз. Потік генерації денойзить латентні представлення, перетворюючи їх на зображення й відео. Обидва потоки спільно використовують механізм уваги та працюють з одним і тим самим KV-кешем.

Коли відповідь потребує пікселів, потік розуміння видає дискретний токен передачі. Потім потік генерації рендерить зображення з усього накопиченого стану. Навчання поєднує передбачення наступного токена для дискретних послідовностей із flow matching для неперервних виходів.

Ця конструкція має практичні наслідки. Обмежувальні рамки видаються як токени координат, а не окремим детектором. Перший кадр відео повторно використовує представлене в контексті зображення замість повторно закодованої копії.

Швидкість: базова версія проти дистильованої

Базова модель генерує відео зі швидкістю 0,79x у реальному часі (медіанне значення), а перегляд прийнятного потоку починається приблизно через 6 секунд. Команда Reka виміряла 7,0 секунди до отримання першого кліпу проти показника 13,8 секунди для ілюстративного мультиагентного конвеєра.

Дистильований варіант скорочує кількість кроків денойзингу з 99 до 8 із мінімальною заявленою втратою якості. Він повернув кліп тривалістю 5,3 секунди приблизно за одну секунду. У внутрішніх тестах Reka він зрівнявся з найшвидшими спеціалізованими моделями для зображень. Також це була найшвидша з протестованих моделей за часом до першого текстового токена. Це тести, проведені постачальником, а не незалежні бенчмарки.

Світова модель і робототехніка

Rho-1 працює безперервно, кліп за кліпом. Нові інструкції надходять через потік розуміння та оновлюють стан у процесі виконання. Reka демонструє один початковий фрагмент, розгалужений на продовження з командами «нахил ліворуч» і «нахил праворуч».

У робототехніці дії та майбутні кадри декодуються з одного латентного стану. Епізод симуляції LIBERO показує, як Rho-1 видає 7 каналів дій. Щоб масштабуватися за межі обмежених журналів телеоперації, Reka поєднує Rho-1 зі своєю моделлю оберненої динаміки, яка виводить керувальні сигнали з необробленого відео.

Порівняння Rho-1

Дані перевірено 5 жовтня 2026 року за офіційними джерелами.

ФункціяReka Rho-1ByteDance BAGELBAAI Emu3.5Google Genie 3
РозробникRekaByteDance SeedBAAIGoogle DeepMind
Параметри19B14B загалом, 7B активних (MoT)34BНе розкрито
ВходиТекст, зображення, відео, дії, пропріоцепціяТекст, зображенняЧергування тексту та зображеньТекстовий запит, навігаційні входи
ВиходиТекст, зображення, відео, дії, пропріоцепціяТекст, зображенняЧергування тексту та зображеньІнтерактивний відеосвіт
Нативна генерація відеоТак, обмежена роздільною здатністю 672×384НіНі (кадри зображень, а не нативні кліпи)Так, 720p при 24 кадрах/с
Керування в реальному часіТак, безперервні розгортанняНіНіТак, події світу можна задавати запитами
Дії роботівНативні неперервні токени дійНіДемонстрації маніпуляцій у фізичному середовищіПриймає навігаційні дії, але не видає їх
Відкриті вагиНіТак, Apache 2.0Так, Apache 2.0Ні
Доступ сьогодніДослідницька попередня версія через contact@reka.aiHugging Face, GitHubHugging Face, застосунок emu.worldProject Genie для передплатників Google AI Ultra
Джерело/РесурсиБлог RekaGitHubHugging FaceБлог DeepMind

Доступ до Genie 3 — згідно з інформацією на сторінці Project Genie; кількість параметрів Emu3.5 — згідно з її карткою моделі на Hugging Face.

Головні висновки

  • Rho-1 — це модель із 19 млрд параметрів, яка читає та створює текст, зображення, відео й дії роботів.
  • Два потоки експертів спільно використовують механізм уваги та один KV-кеш у кожному блоці.
  • Дистиляція скорочує денойзинг із 99 до 8 кроків — приблизно 1 секунда на кліп тривалістю 5,3 с.
  • Модель навчали на 320 H100 протягом 3 місяців; відео обмежене роздільною здатністю 672×384.
  • Лише дослідницька попередня версія: публічних ваг, API чи цін поки немає.

Ознайомтеся з технічними деталями та оголошенням в X. Уся заслуга належить досліднику цього проєкту. Також не соромтеся стежити за нами у Twitter і не забудьте приєднатися до нашого субреддіту про машинне навчання зі 150 тис.+ учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.

Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини