Отвъд моделите на света за конкретни области: JEPA-Anything използва 1 рецепта за 7 области
Изследователи от PhAI Labs, CUHK, Fudan, Stanford, Oxford и Princeton публикуваха JEPA-Anything — независима от домейна рамка за изграждане на модели на света. Вместо да проектира нов предсказващ модел за всяка област, тя прилага една и съща схема за обучение към много различни системи. Рамката разширява архитектурите за предсказване със съвместно вграждане (JEPA) с метод, наречен Orthogonal Predictive Factorization (OPF). Изследователският екип я тества в 7 области: компютърно зрение, биология, клинични траектории, управление, молекулярна динамика, физични полета и метеорология.
Какъв проблем решава JEPA-Anything?
Стандартната JEPA, като I-JEPA или V-JEPA 2, използва кодер на контекста, целеви кодер EMA и един предиктор. Предикторът извежда едно монолитно целево вграждане. Изследователският екип нарича това проблем с разпределянето на капацитета: структурите с висока дисперсия доминират, а по-слабите модове получават противоречиви градиенти.
Как работи Orthogonal Predictive Factorization?
OPF разделя латентната цел с ширина d на K научени подпространства с ширина r, където d = K × r. В повечето експерименти се използва K = 4. Всеки фактор получава специално предназначен предиктор. След това предсказанията на факторите се комбинират чрез псевдообратната матрица на Мур–Пенроуз на проекторната матрица. Резултатът е 1 цялостно латентно състояние за декодиране, планиране или развиване.
Три регуляризатора поддържат полезността на факторите:
- Загуба за ортогоналност: поддържа колоните във всеки проектор ортонормални, а различните проектори — в неприпокриващи се подпространства.
- Загуба за активността на факторите: hinge функция върху стандартното отклонение на координата, така че нито един фактор да не стане неактивен.
- Загуба за дисперсията на кодера: подава директен сигнал срещу колапс към онлайн кодера.
Загубата на OPF просто се добавя към оригиналната загуба за обучение на всеки домейн. Домейн адаптерите обработват токенизацията и кодерите; основната библиотека предоставя споделеното ядро като OrthogonalFactorProjection.
Ортогоналността е важна за стабилния синтез. При CITRIS Interventional Pong модел с множество глави без ограничения и съпоставим капацитет имаше число на обусловеност 438.52. Ортогоналната версия достигна 1.00005, а припокриването между факторите беше близо до нула.
Какви резултати отчита изследването?
Група I, крайно извеждане: При данни от единични клетки клъстерирането на PBMC с нулево обучение (AvgBIO) се повиши до 0.7752 спрямо 0.7194 за Cell-JEPA. Pearson коефициентът за пертурбациите на Norman се повиши от 0.787 до 0.814. При прогнозиране на над 1 000 клинични събития върху данни от UK Biobank средният PRAUC беше 0.718 спрямо 0.711 за съпоставимата стандартна JEPA.
Група II, латентна динамика на света: При Interventional Pong MSE за единична интервенция спадна с 34.83%. Наблюдаваните за първи път комбинирани интервенции се подобриха с 12.90%, а свободното развиване за 6 стъпки — с 8.58%. JEPA-Anything подобри отчетените метрики във всичките 10 съпоставими задачи за динамика. Бенчмарковете включват CausalWorld, DeepMind Control, PDEBench и WeatherBench2. При Burgers в APEBench грешката при развиване за 6 стъпки спадна с около 44.7%, като подобрение се наблюдаваше при всяко начално число. При 100-стъпкови молекулярни развивания с архитектура от типа на TrajCast бяха отчетени най-ниските MAE и RMSD за вода, кварц, парацетамол и бензен.
Резултатите от планирането са смесени. При параметри, съпоставени в рамките на 0.3%, JEPA-Anything подобри възвръщаемостта на CEM при Walker2d и HalfCheetah. Hopper се представи по-добре със стандартната JEPA.
Група III, научен анализ: Анализът на факторите определи IL-18 плюс блокиране на CD73 като интервенция срещу рака. Лабораторните тестове я подкрепиха в ко-култури, органоиди, получени от пациенти, туморни фрагменти и мишки. Латентните орбитални модове също възстановиха закона на Кеплер с апроксимиран наклон −1.4991 спрямо теоретичния −1.5.
Как JEPA-Anything се сравнява с други модели на света?
| Характеристика | JEPA-Anything | V-JEPA 2 | DINO-WM | DreamerV3 | TD-MPC2 |
|---|---|---|---|---|---|
| Основна идея | JEPA с K ортогонални предсказващи фактора | Видео JEPA плюс V-JEPA 2-AC, обусловена от действията | Модел на света върху предварително обучени визуални характеристики | Модел на света плюс актьор-критик, обучен чрез въображение | Латентна динамика без декодер плюс MPC |
| Структура на целта | Факторизирана, комбинирана чрез псевдообратна матрица | Единична латентна цел | Единична латентна цел | Категорийни латентни състояния | Единично латентно състояние |
| Показани домейни | 7: зрение, клетки, клинични данни, управление, молекули, PDE, метеорология | Разбиране на видео, роботизирано манипулиране | PointMaze, PushT, Wall, деформируеми обекти | Разнообразни RL домейни, фиксирани хиперпараметри | 104 задачи за непрекъснато управление, 4 домейна |
| Планиране / развиване | Латентно развиване, планиране с CEM | Планиране от визуални цели | Планиране с CEM | Политика от въображаеми развивания | Планиране с MPC |
| Публични контролни точки | Изследователски контролни точки за всеки домейн в HF | Да, от 300M до 1B (V-JEPA 2) | PointMaze, PushT, Wall | Не са посочени в хранилището | Над 300 контролни точки, до 317M |
| Лиценз | Apache-2.0 | MIT (някои файлове са Apache-2.0) | MIT | MIT | MIT |
Източници: README файловете в GitHub на всеки проект, свързани в заглавния ред. Статусът на контролните точки на JEPA-Anything е взет от неговата карта в Hugging Face. Проверено на 5 октомври 2026 г.
Основни изводи
- OPF разделя 1 цел на JEPA на K ортогонални фактора със специално предназначени предиктори.
- Тя надмина съпоставимите базови модели JEPA във всичките 10 задачи за динамика.
- Грешката при единична интервенция в Interventional Pong спадна с 34.83%.
- Подобренията при планирането зависят от средата; Hopper се представи по-добре със стандартната JEPA.
- Основният код е с лиценз Apache-2.0; изследователските контролни точки са в Hugging Face.
Вижте статията, хранилището в GitHub и контролните точки на модела. Цялата заслуга е на изследователя на този проект. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit с над 150 хил. членове за машинно обучение и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.
Имате нужда от партньор за популяризирането на вашето GitHub хранилище ИЛИ страница в Hugging Face, ИЛИ продуктова премиера, ИЛИ уебинар и т.н.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.