Odyssey-3 е нов генеративен модел на света, който можете да изпробвате безплатно
Основни моменти
- Базираната в Калифорния AI компания Odyssey пусна публична изследователска версия на своя модел на света Odyssey-3.
- Моделът генерира интерактивни среди от текстови описания в реално време, като позволява на потребителите да ги изследват и да взаимодействат с тях от различни перспективи.
- Освен за генериране на виртуални светове Odyssey-3 е проектиран да служи като основа за управление на различни системи — от роботизирани ръце и дронове в симулирани среди до персонажи във видеоигри.
Odyssey предоставя публичен достъп до своя модел на света Odyssey-3. Той генерира интерактивни светове в реално време и постига най-високи резултати в тестове за физика, според компанията.
Базираната в Калифорния AI компания Odyssey пусна публична изследователска версия на своя модел на света Odyssey-3. Потребителите могат да генерират интерактивни среди от текстови описания и да ги изследват в реално време. Моделът симулира физически процеси и прогнозира как средите се променят въз основа на конкретни действия. Разработчиците могат да кандидатстват за достъп до API.
Основателите Оливър Камерън и Джеф Хоук представиха модела за първи път на 15 септември, с фокус върху роботиката, автономното шофиране и видеоигрите. Новото сега е публичният достъп, по-подробната техническа информация и резултатите от тестовете.
Интерактивни AI светове, които можете да изпробвате още сега
Безплатната онлайн демонстрация работи с Odyssey-3 Flash. Моделът генерира интерактивни среди от текстови описания. Потребителите могат да избират между перспектива от първо и от трето лице, да се движат из генерирания свят, да задействат събития и да наблюдават как моделът реагира в реално време.
Odyssey-3 е изграден върху авторегресивен дифузионен трансформатор, който непрекъснато генерира нови видеокадри въз основа на предишните кадри и действията на потребителя. Според Odyssey моделът усвоява физическите зависимости и причинно-следствените връзки от визуални наблюдения по време на обучението.
Данните за обучение включват интернет видеоклипове с описания на събития, кадри от видеоигри, съпоставени със съответните входове от клавиатура и мишка, както и симулирани физически взаимодействия. Допълнителна техника за обучение намалява необходимия брой изчислителни стъпки, което прави възможно генерирането в реално време.
Базовият модел Odyssey-3 има 14 милиарда параметъра и генерира видео с резолюция 832 × 480 пиксела, според официалното представяне в теста. Odyssey-3 Pro поддържа резолюция 1280 × 720 пиксела.
Твърденията за резултатите в тестовете по физика имат някои уговорки
По-мощният Odyssey-3 Pro постига 66,1 точки в теста за преобразуване на видео във видео на Physics-IQ Verified, според компанията. Тестът оценява физическото поведение в области като механика на флуидите, оптика, механика на твърдите тела, магнетизъм и термодинамика. Моделите трябва да продължат видеоклипове на експерименти от реалния свят, а резултатите им се сравняват с действителните резултати.
Този най-висок резултат от 66,1 точки обаче идва с важна уговорка. Той е получен при еднократно изпълнение на теста, при което метод за подбор е избрал едно от осемте генерирани видеа за всяка задача. Правилата на теста изискват четири изпълнения и докладване на стандартното отклонение при претенция за рекорд. Докладваният рекорд не отговаря на това изискване. Без метода за подбор Odyssey-3 Pro постига средно 63,37 точки при четири изпълнения. И двата резултата са посочени в официалната класация, но са подадени от самата Odyssey.

В теста WorldMark Odyssey-3 заема първо място в три от четири категории според собствената си оценка: стилизирано от първо лице (77,2), реалистично от трето лице (79,0) и стилизирано от трето лице (76,3). В категорията „Реалистично от първо лице“ заема трето място с 80,6 точки. WorldMark проверява доколко добре моделите следват инструкции за управление, колко добре изглеждат генерираните изображения и дали симулираните светове остават последователни във времето.
Един модел за роботи, дронове и GTA V
Odyssey иска да използва един и същ модел на света за различни задачи — от движението на роботизирани ръце до навигацията на дронове и управлението на персонажи в игри. За всяко приложение моделът се комбинира със специализиран контролер, който превръща прогнозите му в конкретни команди.
При тестове AI система, изградена върху Odyssey-3, е управлявала множество роботизирани ръце, според компанията. За обучението са били достатъчни няколко десетки часа демонстрационни данни. Роботите са можели и сами да се възстановяват след неуспешно захващане, въпреки че тези ситуации не са били част от данните за обучение.
За хуманоидни роботи Odyssey работи със швейцарската роботизирана компания Flexion. Твърди се, че контролерите, изградени от Flexion върху Odyssey-3, работят по-надеждно от сравнителните модели, дори когато условията се променят.
Odyssey е изградила и контролер за дронове, обучен със симулирани данни от полети. Във виртуална закрита среда дронът е можел да избягва препятствия и да лети до конкретни цели по команда, според компанията.
Odyssey-3 може също да играе видеоигри. Компанията показа AI система, която играе автономно GTA V, управлява превозни средства и се сражава с врагове. Контролер, обучен с приблизително два часа кадри от GTA, е успял да пренесе уменията си и в Red Dead Redemption 2 без допълнително обучение, като е управлявал персонаж на кон.
Odyssey планира да използва своя модел на света и за обучение на AI агенти. В една демонстрация AI агент получава задача на естествен език и се опитва да я изпълни чрез собствените си действия в среда, генерирана от Odyssey-3. Целта е агентите да се учат от резултатите на собствените си действия — потенциално нова парадигма за обучение на AI.
Публичната изследователска версия засега предлага генериране на интерактивни среди, а роботиката и автономните системи ще изискват допълнителна работа.
Надпреварата за създаване на модели на света
Odyssey е основана през 2023 г. от Оливър Камерън и Джеф Хоук. През юни 2026 г. компанията набра 310 милиона долара от инвеститори, сред които Amazon и AMD Ventures.
Моделите на света имат за цел да дадат на AI системите разбиране за пространствените и физическите зависимости. Google DeepMind следва подобен подход с Genie 3 за генериране на интерактивни светове. World Labs, стартъпът, основан от Фей-Фей Ли, разработва сходна технология. AMD обяви в края на септември, че планира да придобие World Labs за приблизително 8,2 милиарда долара.
AI новини без сензацията — подбрани от хора
Абонирайте се за THE DECODER, за да четете без реклами, да получавате седмичен AI бюлетин, нашия ексклузивен тримесечен доклад „AI Radar“ за водещите технологии, пълен достъп до архива и достъп до секцията за коментари.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.