Sakhanda Wire
NVDA $239.24 +0.14% MSFT $529.30 +0.78% GOOGL $347.68 +0.35% META $738.88 -0.41% AMZN $256.29 +1.95%
← Към новините

Отвъд моделите на света за конкретни области: JEPA-Anything използва 1 рецепта за 7 области

Изследователи от PhAI Labs, CUHK, Fudan, Stanford, Oxford и Princeton публикуваха JEPA-Anything — независима от домейна рамка за изграждане на модели на света. Вместо да проектира нов предсказващ модел за всяка област, тя прилага една и съща схема за обучение към много различни системи. Рамката разширява архитектурите за предсказване със съвместно вграждане (JEPA) с метод, наречен Orthogonal Predictive Factorization (OPF). Изследователският екип я тества в 7 области: компютърно зрение, биология, клинични траектории, управление, молекулярна динамика, физични полета и метеорология.

Какъв проблем решава JEPA-Anything?

Стандартната JEPA, като I-JEPA или V-JEPA 2, използва кодер на контекста, целеви кодер EMA и един предиктор. Предикторът извежда едно монолитно целево вграждане. Изследователският екип нарича това проблем с разпределянето на капацитета: структурите с висока дисперсия доминират, а по-слабите модове получават противоречиви градиенти.

Как работи Orthogonal Predictive Factorization?

OPF разделя латентната цел с ширина d на K научени подпространства с ширина r, където d = K × r. В повечето експерименти се използва K = 4. Всеки фактор получава специално предназначен предиктор. След това предсказанията на факторите се комбинират чрез псевдообратната матрица на Мур–Пенроуз на проекторната матрица. Резултатът е 1 цялостно латентно състояние за декодиране, планиране или развиване.

Три регуляризатора поддържат полезността на факторите:

  • Загуба за ортогоналност: поддържа колоните във всеки проектор ортонормални, а различните проектори — в неприпокриващи се подпространства.
  • Загуба за активността на факторите: hinge функция върху стандартното отклонение на координата, така че нито един фактор да не стане неактивен.
  • Загуба за дисперсията на кодера: подава директен сигнал срещу колапс към онлайн кодера.

Загубата на OPF просто се добавя към оригиналната загуба за обучение на всеки домейн. Домейн адаптерите обработват токенизацията и кодерите; основната библиотека предоставя споделеното ядро като OrthogonalFactorProjection.

Ортогоналността е важна за стабилния синтез. При CITRIS Interventional Pong модел с множество глави без ограничения и съпоставим капацитет имаше число на обусловеност 438.52. Ортогоналната версия достигна 1.00005, а припокриването между факторите беше близо до нула.

Какви резултати отчита изследването?

Група I, крайно извеждане: При данни от единични клетки клъстерирането на PBMC с нулево обучение (AvgBIO) се повиши до 0.7752 спрямо 0.7194 за Cell-JEPA. Pearson коефициентът за пертурбациите на Norman се повиши от 0.787 до 0.814. При прогнозиране на над 1 000 клинични събития върху данни от UK Biobank средният PRAUC беше 0.718 спрямо 0.711 за съпоставимата стандартна JEPA.

Група II, латентна динамика на света: При Interventional Pong MSE за единична интервенция спадна с 34.83%. Наблюдаваните за първи път комбинирани интервенции се подобриха с 12.90%, а свободното развиване за 6 стъпки — с 8.58%. JEPA-Anything подобри отчетените метрики във всичките 10 съпоставими задачи за динамика. Бенчмарковете включват CausalWorld, DeepMind Control, PDEBench и WeatherBench2. При Burgers в APEBench грешката при развиване за 6 стъпки спадна с около 44.7%, като подобрение се наблюдаваше при всяко начално число. При 100-стъпкови молекулярни развивания с архитектура от типа на TrajCast бяха отчетени най-ниските MAE и RMSD за вода, кварц, парацетамол и бензен.

Резултатите от планирането са смесени. При параметри, съпоставени в рамките на 0.3%, JEPA-Anything подобри възвръщаемостта на CEM при Walker2d и HalfCheetah. Hopper се представи по-добре със стандартната JEPA.

Група III, научен анализ: Анализът на факторите определи IL-18 плюс блокиране на CD73 като интервенция срещу рака. Лабораторните тестове я подкрепиха в ко-култури, органоиди, получени от пациенти, туморни фрагменти и мишки. Латентните орбитални модове също възстановиха закона на Кеплер с апроксимиран наклон −1.4991 спрямо теоретичния −1.5.

Как JEPA-Anything се сравнява с други модели на света?

ХарактеристикаJEPA-AnythingV-JEPA 2DINO-WMDreamerV3TD-MPC2
Основна идеяJEPA с K ортогонални предсказващи фактораВидео JEPA плюс V-JEPA 2-AC, обусловена от действиятаМодел на света върху предварително обучени визуални характеристикиМодел на света плюс актьор-критик, обучен чрез въображениеЛатентна динамика без декодер плюс MPC
Структура на целтаФакторизирана, комбинирана чрез псевдообратна матрицаЕдинична латентна целЕдинична латентна целКатегорийни латентни състоянияЕдинично латентно състояние
Показани домейни7: зрение, клетки, клинични данни, управление, молекули, PDE, метеорологияРазбиране на видео, роботизирано манипулиранеPointMaze, PushT, Wall, деформируеми обектиРазнообразни RL домейни, фиксирани хиперпараметри104 задачи за непрекъснато управление, 4 домейна
Планиране / развиванеЛатентно развиване, планиране с CEMПланиране от визуални целиПланиране с CEMПолитика от въображаеми развиванияПланиране с MPC
Публични контролни точкиИзследователски контролни точки за всеки домейн в HFДа, от 300M до 1B (V-JEPA 2)PointMaze, PushT, WallНе са посочени в хранилищетоНад 300 контролни точки, до 317M
ЛицензApache-2.0MIT (някои файлове са Apache-2.0)MITMITMIT

Източници: README файловете в GitHub на всеки проект, свързани в заглавния ред. Статусът на контролните точки на JEPA-Anything е взет от неговата карта в Hugging Face. Проверено на 5 октомври 2026 г.

Основни изводи

  • OPF разделя 1 цел на JEPA на K ортогонални фактора със специално предназначени предиктори.
  • Тя надмина съпоставимите базови модели JEPA във всичките 10 задачи за динамика.
  • Грешката при единична интервенция в Interventional Pong спадна с 34.83%.
  • Подобренията при планирането зависят от средата; Hopper се представи по-добре със стандартната JEPA.
  • Основният код е с лиценз Apache-2.0; изследователските контролни точки са в Hugging Face.

Вижте статията, хранилището в GitHub и контролните точки на модела. Цялата заслуга е на изследователя на този проект. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit с над 150 хил. членове за машинно обучение и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.

Имате нужда от партньор за популяризирането на вашето GitHub хранилище ИЛИ страница в Hugging Face, ИЛИ продуктова премиера, ИЛИ уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини