Омні-модель Rho-1 від Reka AI обробляє текст, зображення, відео та керує роботами в одній моделі
Reka AI випустила дослідницьку попередню версію Rho-1. Універсальна модель із 19 мільярдами параметрів обробляє та генерує текст, зображення, відео й команди керування роботами в одній нейронній мережі. На відміну від більшості систем штучного інтелекту, які передають завдання спеціалізованим моделям, Rho-1 обробляє всі модальності як токени в одному спільному контекстному вікні без викликів інструментів чи зовнішніх моделей. Модель генерує безперервне відео в реальному часі та на льоту реагує на нові інструкції, не перезапускаючи роботу.
Ті самі ваги, які прогнозують зображення з камери, також керують рухами робота. Щоб компенсувати нестачу даних для навчання роботів, Reka AI створила модель оберненої динаміки, яка вилучає керувальні сигнали зі звичайних відео з інтернету. Rho-1 навчали на 320 графічних процесорах H100 протягом приблизно трьох місяців.
Reka AI не новачок у мультимодальному штучному інтелекті. У квітні 2024 року компанія представила Reka Core — мультимодальну мовну модель, яка конкурувала з GPT-4, Claude 3 і Gemini Ultra за результатами тестів. Цей реліз відповідає ширшій тенденції в дослідженнях ШІ до так званих моделей світу.
Новини ШІ без хайпу — відібрані людьми
Підпишіться на THE DECODER, щоб читати матеріали без реклами, отримувати щотижневу розсилку про ШІ, наш ексклюзивний звіт про передові розробки «AI Radar» шість разів на рік, повний доступ до архіву та доступ до розділу коментарів.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.