Поза межами предметно-специфічних світових моделей: JEPA-Anything використовує 1 рецепт для 7 сфер
Дослідники з PhAI Labs, CUHK, Fudan, Stanford, Oxford і Princeton представили JEPA-Anything — предметно-агностичний фреймворк для побудови світових моделей. Замість розроблення нової прогностичної моделі для кожної галузі він застосовує один спільний підхід до навчання для дуже різних систем. Він розширює архітектури прогнозування зі спільними вкладеннями (JEPA) методом, який називається ортогональною факторизацією прогнозування (OPF). Дослідницька команда протестувала його у 7 галузях: комп’ютерному зорі, біології, клінічних траєкторіях, керуванні, молекулярній динаміці, фізичних полях і погоді.
Яку проблему розв’язує JEPA-Anything?
Стандартна JEPA, така як I-JEPA або V-JEPA 2, використовує кодер контексту, цільовий кодер EMA і один предиктор. Предиктор генерує одну монолітну цільову репрезентацію. Дослідницька команда називає це проблемою розподілу ємності: структура з високою дисперсією домінує, а слабші моди отримують суперечливі градієнти.
Як працює ортогональна факторизація прогнозування?
OPF розділяє латентну цільову репрезентацію ширини d на K навчених підпросторів ширини r, де d = K × r. У більшості експериментів використовується K = 4. Кожен фактор отримує окремий предиктор. Потім прогнози факторів повторно об’єднуються через псевдообернену за Муром—Пенроузом матриці проєктора. Результатом є 1 повний латентний стан для декодування, планування або розгортання.
Три регуляризатори забезпечують корисність факторів:
- Втрата ортогональності: забезпечує ортонормованість стовпців усередині кожного проєктора та розміщення різних проєкторів у неперекривних підпросторах.
- Втрата активності факторів: hinge-функція для стандартного відхилення кожної координати, щоб жоден фактор не став неактивним.
- Втрата дисперсії кодера: передає безпосередній сигнал проти колапсу онлайн-кодеру.
Втрата OPF просто додається до початкової втрати навчання кожної галузі. Галузеві адаптери відповідають за токенізацію та кодери; основна бібліотека надає спільне ядро як OrthogonalFactorProjection.
Ортогональність важлива для стабільного синтезу. На CITRIS Interventional Pong модель із кількома головами без обмежень і зі зіставною ємністю мала число обумовленості 438.52. Ортогональна версія досягла показника 1.00005, а перекриття між факторами було близьким до нуля.
Про які результати повідомляють дослідники?
Група I, кінцеве зчитування: На одноклітинних даних кластеризація PBMC у режимі zero-shot (AvgBIO) зросла до 0.7752 проти 0.7194 у Cell-JEPA. Показник кореляції Пірсона для збурень Norman зріс із 0.787 до 0.814. Для прогнозування понад 1,000 клінічних подій на даних UK Biobank середній PRAUC становив 0.718 проти 0.711 у зіставної стандартної JEPA.
Група II, латентна динаміка світу: На Interventional Pong MSE для одиничного втручання знизилася на 34.83%. Результат для невидимих комбінованих втручань покращився на 12.90%, а для 6-крокового вільного розгортання — на 8.58%. JEPA-Anything покращила наведені метрики в усіх 10 зіставних завданнях динаміки. Бенчмарки включають CausalWorld, DeepMind Control, PDEBench і WeatherBench2. На APEBench Burgers похибка 6-крокового розгортання зменшилася приблизно на 44.7%, причому покращення спостерігалося для кожного seed. Для 100-крокових молекулярних розгортань із бекбоном у стилі TrajCast модель показала найнижчі MAE і RMSD для води, кварцу, парацетамолу та бензену.
Результати планування неоднозначні. За різниці в кількості параметрів у межах 0.3% JEPA-Anything покращила дохід CEM у Walker2d і HalfCheetah. У Hopper перевагу отримала стандартна JEPA.
Група III, науковий аналіз: Факторний аналіз визначив IL-18 разом із блокадою CD73 як втручання проти раку. Лабораторні випробування підтвердили це в кокультурах, органоїдах, отриманих від пацієнтів, фрагментах пухлин і мишах. Латентні орбітальні моди також відновили закон Кеплера з апроксимованим нахилом −1.4991 проти теоретичного −1.5.
Як JEPA-Anything порівнюється з іншими світовими моделями?
| Характеристика | JEPA-Anything | V-JEPA 2 | DINO-WM | DreamerV3 | TD-MPC2 |
|---|---|---|---|---|---|
| Основна ідея | JEPA з K ортогональними прогностичними факторами | Відео-JEPA плюс V-JEPA 2-AC із врахуванням дій | Світова модель на попередньо навчених візуальних ознаках | Світова модель плюс актор-критик, навчений в уяві | Латентна динаміка без декодера плюс MPC |
| Структура цілі | Факторизована, повторно об’єднана через псевдообернену | Одна латентна ціль | Одна латентна ціль | Категоріальні латентні стани | Один латентний стан |
| Продемонстровані галузі | 7: комп’ютерний зір, клітини, клінічні дані, керування, молекули, PDE, погода | Розуміння відео, роботизовані маніпуляції | PointMaze, PushT, Wall, деформовані об’єкти | Різноманітні галузі RL, фіксовані гіперпараметри | 104 завдання безперервного керування, 4 галузі |
| Планування / розгортання | Латентне розгортання, планування CEM | Планування на основі цілей-зображень | Планування CEM | Політика на основі уявних розгортань | Планування MPC |
| Публічні контрольні точки | Дослідницькі контрольні точки для кожної галузі на HF | Так, від 300M до 1B (V-JEPA 2) | PointMaze, PushT, Wall | У репозиторії не зазначені | Понад 300 контрольних точок, до 317M |
| Ліцензія | Apache-2.0 | MIT (деякі файли Apache-2.0) | MIT | MIT | MIT |
Джерела: README-файли GitHub кожного проєкту, посилання на які наведено в рядку заголовків. Статус контрольних точок JEPA-Anything — із його картки Hugging Face. Перевірено 5 жовтня 2026 року.
Ключові висновки
- OPF розділяє 1 ціль JEPA на K ортогональних факторів з окремими предикторами.
- Вона перевершила зіставні базові моделі JEPA в усіх 10 завданнях динаміки.
- Помилка для одиничного втручання в Interventional Pong зменшилася на 34.83%.
- Переваги в плануванні залежать від середовища; у Hopper перевагу отримала стандартна JEPA.
- Основний код доступний за ліцензією Apache-2.0; дослідницькі контрольні точки розміщені на Hugging Face.
Ознайомтеся з дослідницькою статтею, репозиторієм GitHub і контрольними точками моделей. Уся подяка досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабреддіту 150k+ ML та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.
Потрібне партнерство з нами для просування вашого репозиторію GitHub, сторінки Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.