Reka представила Rho-1: омні-модель міркування на 19B параметрів, яка розуміє та генерує відео й видає дії для роботів в одній системі
Reka випустила дослідницьку попередню версію Rho-1 — омні-модель для міркувань із 19 млрд параметрів, навчену з нуля. Одна нейронна мережа розуміє та генерує текст, зображення й відео, міркує над ними та видає дії для роботів. Reka позиціонує її як пряму заміну агентним конвеєрам, які передають завдання між моделями, спеціалізованими на окремих модальностях.
Що змінює Rho-1
Більшість мультимодальних систем сьогодні є конвеєрами. Центральна модель планує, а потім передає завдання спеціалістам із роботи із зображеннями, відео чи виявленням об’єктів. Кожна передача додає затримку, а кожен спеціаліст бачить лише вузький запит.
Rho-1 усуває ці передачі. Текст, зображення та дії роботів стають токенами в одному контекстному вікні. Згідно з дослідженням Reka, одна невідредагована сесія демонструє весь цикл. Модель малює маяк, обводить його рамкою, анімує, редагує відео, перетворюючи його на заметіль, і пояснює різницю. Усе це відбувається за 5 ходів, без виклику інструментів і без другої моделі.
Архітектура: два потоки, один KV-кеш
Кожен вхід і вихід використовує один із двох нативних форматів:
- Дискретні токени містять текст, символьні міркування та команди високого рівня.
- Неперервні токени містять латентні представлення зображень, кадри відео, дії роботів і пропріоцепцію.
Кожен трансформерний блок містить два потоки експертних ваг. Потік розуміння обробляє мову та візуальний аналіз. Потік генерації денойзить латентні представлення, перетворюючи їх на зображення й відео. Обидва потоки спільно використовують механізм уваги та працюють з одним і тим самим KV-кешем.
Коли відповідь потребує пікселів, потік розуміння видає дискретний токен передачі. Потім потік генерації рендерить зображення з усього накопиченого стану. Навчання поєднує передбачення наступного токена для дискретних послідовностей із flow matching для неперервних виходів.
Ця конструкція має практичні наслідки. Обмежувальні рамки видаються як токени координат, а не окремим детектором. Перший кадр відео повторно використовує представлене в контексті зображення замість повторно закодованої копії.
Швидкість: базова версія проти дистильованої
Базова модель генерує відео зі швидкістю 0,79x у реальному часі (медіанне значення), а перегляд прийнятного потоку починається приблизно через 6 секунд. Команда Reka виміряла 7,0 секунди до отримання першого кліпу проти показника 13,8 секунди для ілюстративного мультиагентного конвеєра.
Дистильований варіант скорочує кількість кроків денойзингу з 99 до 8 із мінімальною заявленою втратою якості. Він повернув кліп тривалістю 5,3 секунди приблизно за одну секунду. У внутрішніх тестах Reka він зрівнявся з найшвидшими спеціалізованими моделями для зображень. Також це була найшвидша з протестованих моделей за часом до першого текстового токена. Це тести, проведені постачальником, а не незалежні бенчмарки.
Світова модель і робототехніка
Rho-1 працює безперервно, кліп за кліпом. Нові інструкції надходять через потік розуміння та оновлюють стан у процесі виконання. Reka демонструє один початковий фрагмент, розгалужений на продовження з командами «нахил ліворуч» і «нахил праворуч».
У робототехніці дії та майбутні кадри декодуються з одного латентного стану. Епізод симуляції LIBERO показує, як Rho-1 видає 7 каналів дій. Щоб масштабуватися за межі обмежених журналів телеоперації, Reka поєднує Rho-1 зі своєю моделлю оберненої динаміки, яка виводить керувальні сигнали з необробленого відео.
Порівняння Rho-1
Дані перевірено 5 жовтня 2026 року за офіційними джерелами.
| Функція | Reka Rho-1 | ByteDance BAGEL | BAAI Emu3.5 | Google Genie 3 |
|---|---|---|---|---|
| Розробник | Reka | ByteDance Seed | BAAI | Google DeepMind |
| Параметри | 19B | 14B загалом, 7B активних (MoT) | 34B | Не розкрито |
| Входи | Текст, зображення, відео, дії, пропріоцепція | Текст, зображення | Чергування тексту та зображень | Текстовий запит, навігаційні входи |
| Виходи | Текст, зображення, відео, дії, пропріоцепція | Текст, зображення | Чергування тексту та зображень | Інтерактивний відеосвіт |
| Нативна генерація відео | Так, обмежена роздільною здатністю 672×384 | Ні | Ні (кадри зображень, а не нативні кліпи) | Так, 720p при 24 кадрах/с |
| Керування в реальному часі | Так, безперервні розгортання | Ні | Ні | Так, події світу можна задавати запитами |
| Дії роботів | Нативні неперервні токени дій | Ні | Демонстрації маніпуляцій у фізичному середовищі | Приймає навігаційні дії, але не видає їх |
| Відкриті ваги | Ні | Так, Apache 2.0 | Так, Apache 2.0 | Ні |
| Доступ сьогодні | Дослідницька попередня версія через contact@reka.ai | Hugging Face, GitHub | Hugging Face, застосунок emu.world | Project Genie для передплатників Google AI Ultra |
| Джерело/Ресурси | Блог Reka | GitHub | Hugging Face | Блог DeepMind |
Доступ до Genie 3 — згідно з інформацією на сторінці Project Genie; кількість параметрів Emu3.5 — згідно з її карткою моделі на Hugging Face.
Головні висновки
- Rho-1 — це модель із 19 млрд параметрів, яка читає та створює текст, зображення, відео й дії роботів.
- Два потоки експертів спільно використовують механізм уваги та один KV-кеш у кожному блоці.
- Дистиляція скорочує денойзинг із 99 до 8 кроків — приблизно 1 секунда на кліп тривалістю 5,3 с.
- Модель навчали на 320 H100 протягом 3 місяців; відео обмежене роздільною здатністю 672×384.
- Лише дослідницька попередня версія: публічних ваг, API чи цін поки немає.
Ознайомтеся з технічними деталями та оголошенням в X. Уся заслуга належить досліднику цього проєкту. Також не соромтеся стежити за нами у Twitter і не забудьте приєднатися до нашого субреддіту про машинне навчання зі 150 тис.+ учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.
Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.