Омни-моделът Rho-1 на Reka AI обработва текст, изображения, видео и управлява роботи в един модел
Reka AI пусна предварителна изследователска версия на Rho-1. Омнимоделът с 19 милиарда параметъра обработва и генерира текст, изображения, видео и действия за управление на роботи в една невронна мрежа. За разлика от повечето системи с изкуствен интелект, които насочват задачите към специализирани модели, Rho-1 обработва всички модалности като токени в един общ контекстен прозорец, без извиквания на инструменти или външни модели. Моделът генерира непрекъснато видео в реално време и реагира на нови инструкции в движение, без да се рестартира.
Същите тегла, които предсказват изображенията от камерата, управляват и движенията на робота. За да компенсира недостига на данни за обучение на роботи, Reka AI създаде модел на обратната динамика, който извлича управляващи сигнали от обикновени интернет видеоклипове. Rho-1 е обучен върху 320 графични процесора H100 за около три месеца.
Reka AI не е нова в областта на мултимодалния изкуствен интелект. През април 2024 г. компанията пусна Reka Core — мултимодален езиков модел, който се конкурира с GPT-4, Claude 3 и Gemini Ultra в бенчмаркове. Пускането му се вписва в по-широката тенденция в изследванията на изкуствения интелект към т.нар. световни модели.
Новини за изкуствения интелект без сензации – подбрани от хора
Абонирайте се за THE DECODER и получете четене без реклами, седмичен бюлетин за изкуствения интелект, нашия ексклузивен шест пъти годишно доклад „AI Radar“ за водещите разработки, пълен достъп до архива и достъп до секцията за коментари.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.