За пределами предметно-специализированных мировых моделей: JEPA-Anything использует 1 рецепт для 7 областей
Исследователи из PhAI Labs, CUHK, Fudan, Stanford, Oxford и Princeton представили JEPA-Anything — не зависящую от предметной области платформу для построения мировых моделей. Вместо разработки новой предсказательной модели для каждой области она применяет единую схему обучения к самым разным системам. Она расширяет архитектуры предсказания с совместным встраиванием (JEPA) методом, получившим название ортогональная факторизация предсказаний (Orthogonal Predictive Factorization, OPF). Исследовательская команда протестировала её в 7 областях: компьютерном зрении, биологии, клинических траекториях, управлении, молекулярной динамике, физических полях и погоде.
Какую проблему решает JEPA-Anything?
Стандартная JEPA, например I-JEPA или V-JEPA 2, использует кодировщик контекста, целевой кодировщик EMA и один предиктор. Предиктор выдаёт одно монолитное целевое встраивание. Исследовательская команда называет это проблемой распределения ёмкости: структура с высокой дисперсией доминирует, а более слабые моды получают конфликтующие градиенты.
Как работает ортогональная факторизация предсказаний?
OPF разделяет латентную цель ширины d на K обучаемых подпространств ширины r, где d = K × r. В большинстве экспериментов используется K = 4. Каждый фактор получает отдельный предиктор. Затем предсказания факторов повторно объединяются с помощью псевдообратной матрицы Мура — Пенроуза проекторной матрицы. В результате получается 1 полное латентное состояние для декодирования, планирования или развёртывания.
Три регуляризатора поддерживают полезность факторов:
- Потеря ортогональности: сохраняет ортонормальность столбцов внутри каждого проектора и обеспечивает нахождение разных проекторов в непересекающихся подпространствах.
- Потеря активности факторов: использует hinge-функцию для стандартного отклонения по отдельным координатам, чтобы ни один фактор не стал неактивным.
- Потеря дисперсии кодировщика: направляет непосредственный сигнал против схлопывания онлайн-кодировщику.
Потеря OPF просто добавляется к исходной функции потерь каждой предметной области. Адаптеры областей отвечают за токенизацию и кодировщики; библиотека ядра предоставляет общий компонент в виде OrthogonalFactorProjection.
Ортогональность важна для стабильного синтеза. На задаче CITRIS Interventional Pong несвязная многоголовочная модель с сопоставимой ёмкостью имела число обусловленности 438.52. Ортогональная версия достигла значения 1.00005, а перекрытие между факторами оказалось близким к нулю.
О каких результатах сообщает исследование?
Группа I, итоговое считывание: На данных отдельных клеток кластеризация PBMC без дополнительного обучения (AvgBIO) выросла до 0.7752 против 0.7194 у Cell-JEPA. Корреляция Пирсона для возмущений Norman выросла с 0.787 до 0.814. При прогнозировании более 1 000 клинических событий на данных UK Biobank среднее значение PRAUC составило 0.718 против 0.711 у сопоставимой стандартной JEPA.
Группа II, латентная динамика мира: На Interventional Pong среднеквадратичная ошибка (MSE) для единичного вмешательства снизилась на 34.83%. Результат для невиданных комбинированных вмешательств улучшился на 12.90%, а для 6-шагового свободного развёртывания — на 8.58%. JEPA-Anything улучшила заявленные метрики во всех 10 сопоставимых задачах динамики. В число бенчмарков входят CausalWorld, DeepMind Control, PDEBench и WeatherBench2. На задаче Burgers в APEBench ошибка 6-шагового развёртывания снизилась примерно на 44.7%, причём улучшение наблюдалось при каждом начальном значении. В 100-шаговых молекулярных развёртываниях с магистралью в стиле TrajCast модель показала наименьшие значения MAE и RMSD для воды, кварца, парацетамола и бензола.
Результаты планирования неоднозначны. При сопоставимой с точностью до 0.3% численности параметров JEPA-Anything улучшила возврат CEM на Walker2d и HalfCheetah. В Hopper преимущество было у стандартной JEPA.
Группа III, научный анализ: Факторный анализ выдвинул комбинацию IL-18 и блокады CD73 в качестве противоракового вмешательства. Лабораторные испытания подтвердили её эффективность в сокультурах, органоидах, полученных от пациентов, фрагментах опухолей и на мышах. Латентные орбитальные моды также восстановили закон Кеплера с рассчитанным наклоном −1.4991 против теоретического значения −1.5.
Как JEPA-Anything сравнивается с другими мировыми моделями?
| Характеристика | JEPA-Anything | V-JEPA 2 | DINO-WM | DreamerV3 | TD-MPC2 |
|---|---|---|---|---|---|
| Основная идея | JEPA с K ортогональными предсказательными факторами | Видео-JEPA плюс V-JEPA 2-AC с учётом действий | Мировая модель на предварительно обученных визуальных признаках | Мировая модель плюс актор-критик, обучаемый в воображении | Латентная динамика без декодера плюс MPC |
| Структура цели | Факторизованная, повторно объединяется с помощью псевдообратной матрицы | Единая латентная цель | Единая латентная цель | Категориальные латентные состояния | Единое латентное состояние |
| Представленные области | 7: зрение, клетки, клинические данные, управление, молекулы, уравнения в частных производных, погода | Понимание видео, манипуляции роботами | PointMaze, PushT, Wall, деформируемые объекты | Разнообразные области RL, фиксированные гиперпараметры | 104 задачи непрерывного управления, 4 области |
| Планирование / развёртывание | Латентное развёртывание, планирование CEM | Планирование по целям-изображениям | Планирование CEM | Политика на основе развёртываний в воображении | Планирование MPC |
| Общедоступные контрольные точки | Исследовательские контрольные точки для отдельных областей на HF | Да, от 300 млн до 1 млрд (V-JEPA 2) | PointMaze, PushT, Wall | Не указаны в репозитории | Более 300 контрольных точек, до 317 млн |
| Лицензия | Apache-2.0 | MIT (некоторые файлы — Apache-2.0) | MIT | MIT | MIT |
Источники: README-файлы GitHub каждого проекта, ссылки на которые приведены в строке заголовка. Статус контрольных точек JEPA-Anything указан в её карточке на Hugging Face. Проверено 5 октября 2026 года.
Главные выводы
- OPF разделяет 1 цель JEPA на K ортогональных факторов с отдельными предикторами.
- Она превзошла сопоставимые базовые модели JEPA во всех 10 задачах динамики.
- Ошибка при единичном вмешательстве в Interventional Pong снизилась на 34.83%.
- Преимущества в планировании зависят от среды; в Hopper лучшей оказалась стандартная JEPA.
- Основной код распространяется по лицензии Apache-2.0; исследовательские контрольные точки размещены на Hugging Face.
Ознакомьтесь с статьёй, репозиторием GitHub и контрольными точками моделей. Вся благодарность — исследователям этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту по машинному обучению с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.
Хотите сотрудничать с нами для продвижения вашего репозитория GitHub, страницы на Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.