Odyssey-3 — нова генеративна модель світу, яку можна безкоштовно випробувати
Ключові моменти
- Каліфорнійська компанія зі штучного інтелекту Odyssey запустила загальнодоступну дослідницьку версію своєї моделі світу Odyssey-3.
- Модель у реальному часі генерує інтерактивні середовища з текстових запитів, дозволяючи користувачам досліджувати їх і взаємодіяти з ними з різних перспектив.
- Окрім генерації віртуальних світів, Odyssey-3 розроблена як основа для керування різними системами — від роботизованих маніпуляторів і дронів у змодельованих середовищах до персонажів у відеоіграх.
Odyssey відкриває загальний доступ до своєї моделі світу Odyssey-3. За словами компанії, вона генерує інтерактивні світи в реальному часі й демонструє найкращі результати у фізичних бенчмарках.
Каліфорнійська компанія зі штучного інтелекту Odyssey запустила загальнодоступну дослідницьку версію своєї моделі світу Odyssey-3. Користувачі можуть генерувати інтерактивні середовища за текстовими запитами та досліджувати їх у реальному часі. Модель симулює фізичні процеси й передбачає, як середовища змінюються залежно від конкретних дій. Розробники можуть подати заявку на доступ до API.
Засновники Олівер Кемерон і Джефф Гоук вперше представили модель 15 вересня, зосередившись на робототехніці, автономному водінні та відеоіграх. Новим цього разу є публічний доступ, докладніша технічна інформація та результати бенчмарків.
Інтерактивні світи ШІ, які можна спробувати просто зараз
Безкоштовна онлайн-демоверсія працює на Odyssey-3 Flash. Модель генерує інтерактивні середовища з текстових описів. Користувачі можуть обирати перспективу від першої або третьої особи, пересуватися згенерованим світом, запускати події та спостерігати за реакцією моделі в реальному часі.
Odyssey-3 побудована на авторегресійному дифузійному трансформері, який безперервно генерує нові відеокадри на основі попередніх кадрів і дій користувача. За словами Odyssey, під час навчання модель вивчає фізичні взаємозв’язки, а також причинно-наслідкові зв’язки з візуальних спостережень.
До навчальних даних увійшли інтернет-відео з описами подій, відеозаписи ігор у поєднанні з відповідними натисканнями клавіш і рухами миші, а також змодельовані фізичні взаємодії. Додатковий метод навчання зменшує кількість необхідних обчислювальних кроків, уможливлюючи генерацію в реальному часі.
Базова модель Odyssey-3 має 14 мільярдів параметрів і генерує відео з роздільною здатністю 832 × 480 пікселів, згідно з офіційною заявкою на участь у бенчмарку. Odyssey-3 Pro підтримує роздільну здатність 1280 × 720 пікселів.
Заявлені результати у фізичному бенчмарку мають застереження
За даними компанії, потужніша Odyssey-3 Pro набирає 66,1 бала у бенчмарку перетворення відео на відео від Physics-IQ Verified. Тест оцінює фізичну поведінку в таких сферах, як механіка рідин, оптика, механіка твердих тіл, магнетизм і термодинаміка. Моделі мають продовжувати відео реальних експериментів, а їхні результати порівнюють із фактичними наслідками.
Однак цей найвищий результат — 66,1 бала — має важливе застереження. Його отримано під час одного тестового запуску, у якому метод відбору обрав одне з восьми згенерованих відео для кожного завдання. Правила бенчмарку вимагають чотирьох тестових запусків із зазначенням стандартного відхилення для будь-якої заявки на рекорд. Заявлений рекорд цій вимозі не відповідає. Без використання методу відбору Odyssey-3 Pro у середньому набрала 63,37 бала за чотири запуски. Обидва результати наведені в офіційній таблиці лідерів, але їх подала сама Odyssey.

У бенчмарку WorldMark Odyssey-3 посідає перше місце у трьох із чотирьох категорій згідно з власною оцінкою: стилізована перспектива від першої особи (77,2), реалістична перспектива від третьої особи (79,0) і стилізована перспектива від третьої особи (76,3). У категорії «Реалістична перспектива від першої особи» вона посідає третє місце з результатом 80,6 бала. WorldMark перевіряє, наскільки добре моделі виконують інструкції керування, наскільки якісно виглядають згенеровані зображення та чи зберігають змодельовані світи послідовність із часом.
Одна модель для роботів, дронів і GTA V
Odyssey хоче використовувати одну й ту саму модель світу для різних завдань: від переміщення роботизованих маніпуляторів до навігації дронів і керування ігровими персонажами. Для кожного застосування модель поєднують зі спеціалізованим контролером, який перетворює її передбачення на конкретні команди.
За словами компанії, під час тестів ШІ на базі Odyssey-3 керував кількома роботизованими маніпуляторами. Для навчання було достатньо кількох десятків годин демонстраційних даних. Роботи також могли самостійно відновлюватися після невдалих захоплень, хоча такі ситуації не входили до навчальних даних.
Для гуманоїдних роботів Odyssey співпрацює зі швейцарською робототехнічною компанією Flexion. Стверджується, що контролери, створені Flexion на базі Odyssey-3, працюють надійніше за порівнювані моделі навіть за зміни умов.
Odyssey також створила контролер дрона, навчений на змодельованих даних польотів. У віртуальному приміщенні дрон міг ухилятися від перешкод і за командою летіти до визначених цілей, повідомляє компанія.
Odyssey-3 також може грати у відеоігри. Компанія продемонструвала, як ШІ автономно грає в GTA V, керує транспортними засобами та бореться з ворогами. Контролер, навчений приблизно на двох годинах відеозаписів GTA, також зміг перенести свої навички до Red Dead Redemption 2 без додаткового навчання, керуючи персонажем верхи.
Odyssey також планує використовувати свою модель світу для навчання ШІ-агентів. В одній із демонстрацій ШІ-агент отримав завдання природною мовою та намагався виконати його власними діями всередині середовища, згенерованого Odyssey-3. Мета полягає в тому, щоб агенти навчалися на результатах власних дій — потенційно нова парадигма навчання для ШІ.
Наразі загальнодоступна дослідницька версія пропонує генерацію інтерактивних середовищ, однак робототехнічні й автономні системи потребуватимуть подальшої роботи.
Гонка за створення моделей світу
Компанію Odyssey заснували у 2023 році Олівер Кемерон і Джефф Гоук. У червні 2026 року компанія залучила 310 мільйонів доларів від інвесторів, зокрема Amazon і AMD Ventures.
Моделі світу покликані надати системам ШІ розуміння просторових і фізичних взаємозв’язків. Google DeepMind застосовує подібний підхід із Genie 3 для генерації інтерактивних світів. World Labs, стартап, заснований Фей-Фей Лі, розробляє подібну технологію. Наприкінці вересня AMD оголосила, що планує придбати World Labs приблизно за 8,2 мільярда доларів.
Новини ШІ без хайпу — відібрані людьми
Підпишіться на THE DECODER, щоб читати без реклами, отримувати щотижневу розсилку про ШІ, наш ексклюзивний щорічний звіт про передові технології «AI Radar», доступ до повного архіву та розділу коментарів.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.