Омни-модель Rho-1 от Reka AI обрабатывает текст, изображения, видео и управляет роботами в одной модели
Reka AI выпустила предварительную исследовательскую версию Rho-1. Универсальная модель с 19 миллиардами параметров обрабатывает и генерирует текст, изображения, видео и команды управления роботами в рамках одной нейронной сети. В отличие от большинства ИИ-систем, которые направляют задачи специализированным моделям, Rho-1 обрабатывает все модальности как токены в одном общем контекстном окне — без вызовов инструментов и внешних моделей. Модель генерирует непрерывное видео в реальном времени и на лету реагирует на новые инструкции, не начиная работу заново.
Те же веса, которые предсказывают изображения с камеры, управляют и движениями робота. Чтобы компенсировать нехватку данных для обучения роботов, Reka AI создала модель обратной динамики, извлекающую управляющие сигналы из обычных интернет-видео. Rho-1 обучалась на 320 графических процессорах H100 в течение примерно трёх месяцев.
Reka AI уже имеет опыт работы с мультимодальным ИИ. В апреле 2024 года компания выпустила Reka Core — мультимодальную языковую модель, которая конкурировала с GPT-4, Claude 3 и Gemini Ultra в тестах. Этот релиз соответствует более широкому направлению исследований в области ИИ, связанному с так называемыми моделями мира.
Новости об ИИ без шумихи — отобраны людьми
Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ и эксклюзивный отчёт о передовых разработках «AI Radar» шесть раз в год, иметь полный доступ к архиву и возможность оставлять комментарии.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.