Sakhanda Wire
NVDA $239.24 +0.14% MSFT $529.30 +0.78% GOOGL $347.68 +0.35% META $738.88 -0.41% AMZN $256.29 +1.95%
← К новостям

За пределами предметно-специализированных мировых моделей: JEPA-Anything использует 1 рецепт для 7 областей

Исследователи из PhAI Labs, CUHK, Fudan, Stanford, Oxford и Princeton представили JEPA-Anything — не зависящую от предметной области платформу для построения мировых моделей. Вместо разработки новой предсказательной модели для каждой области она применяет единую схему обучения к самым разным системам. Она расширяет архитектуры предсказания с совместным встраиванием (JEPA) методом, получившим название ортогональная факторизация предсказаний (Orthogonal Predictive Factorization, OPF). Исследовательская команда протестировала её в 7 областях: компьютерном зрении, биологии, клинических траекториях, управлении, молекулярной динамике, физических полях и погоде.

Какую проблему решает JEPA-Anything?

Стандартная JEPA, например I-JEPA или V-JEPA 2, использует кодировщик контекста, целевой кодировщик EMA и один предиктор. Предиктор выдаёт одно монолитное целевое встраивание. Исследовательская команда называет это проблемой распределения ёмкости: структура с высокой дисперсией доминирует, а более слабые моды получают конфликтующие градиенты.

Как работает ортогональная факторизация предсказаний?

OPF разделяет латентную цель ширины d на K обучаемых подпространств ширины r, где d = K × r. В большинстве экспериментов используется K = 4. Каждый фактор получает отдельный предиктор. Затем предсказания факторов повторно объединяются с помощью псевдообратной матрицы Мура — Пенроуза проекторной матрицы. В результате получается 1 полное латентное состояние для декодирования, планирования или развёртывания.

Три регуляризатора поддерживают полезность факторов:

  • Потеря ортогональности: сохраняет ортонормальность столбцов внутри каждого проектора и обеспечивает нахождение разных проекторов в непересекающихся подпространствах.
  • Потеря активности факторов: использует hinge-функцию для стандартного отклонения по отдельным координатам, чтобы ни один фактор не стал неактивным.
  • Потеря дисперсии кодировщика: направляет непосредственный сигнал против схлопывания онлайн-кодировщику.

Потеря OPF просто добавляется к исходной функции потерь каждой предметной области. Адаптеры областей отвечают за токенизацию и кодировщики; библиотека ядра предоставляет общий компонент в виде OrthogonalFactorProjection.

Ортогональность важна для стабильного синтеза. На задаче CITRIS Interventional Pong несвязная многоголовочная модель с сопоставимой ёмкостью имела число обусловленности 438.52. Ортогональная версия достигла значения 1.00005, а перекрытие между факторами оказалось близким к нулю.

О каких результатах сообщает исследование?

Группа I, итоговое считывание: На данных отдельных клеток кластеризация PBMC без дополнительного обучения (AvgBIO) выросла до 0.7752 против 0.7194 у Cell-JEPA. Корреляция Пирсона для возмущений Norman выросла с 0.787 до 0.814. При прогнозировании более 1 000 клинических событий на данных UK Biobank среднее значение PRAUC составило 0.718 против 0.711 у сопоставимой стандартной JEPA.

Группа II, латентная динамика мира: На Interventional Pong среднеквадратичная ошибка (MSE) для единичного вмешательства снизилась на 34.83%. Результат для невиданных комбинированных вмешательств улучшился на 12.90%, а для 6-шагового свободного развёртывания — на 8.58%. JEPA-Anything улучшила заявленные метрики во всех 10 сопоставимых задачах динамики. В число бенчмарков входят CausalWorld, DeepMind Control, PDEBench и WeatherBench2. На задаче Burgers в APEBench ошибка 6-шагового развёртывания снизилась примерно на 44.7%, причём улучшение наблюдалось при каждом начальном значении. В 100-шаговых молекулярных развёртываниях с магистралью в стиле TrajCast модель показала наименьшие значения MAE и RMSD для воды, кварца, парацетамола и бензола.

Результаты планирования неоднозначны. При сопоставимой с точностью до 0.3% численности параметров JEPA-Anything улучшила возврат CEM на Walker2d и HalfCheetah. В Hopper преимущество было у стандартной JEPA.

Группа III, научный анализ: Факторный анализ выдвинул комбинацию IL-18 и блокады CD73 в качестве противоракового вмешательства. Лабораторные испытания подтвердили её эффективность в сокультурах, органоидах, полученных от пациентов, фрагментах опухолей и на мышах. Латентные орбитальные моды также восстановили закон Кеплера с рассчитанным наклоном −1.4991 против теоретического значения −1.5.

Как JEPA-Anything сравнивается с другими мировыми моделями?

ХарактеристикаJEPA-AnythingV-JEPA 2DINO-WMDreamerV3TD-MPC2
Основная идеяJEPA с K ортогональными предсказательными факторамиВидео-JEPA плюс V-JEPA 2-AC с учётом действийМировая модель на предварительно обученных визуальных признакахМировая модель плюс актор-критик, обучаемый в воображенииЛатентная динамика без декодера плюс MPC
Структура целиФакторизованная, повторно объединяется с помощью псевдообратной матрицыЕдиная латентная цельЕдиная латентная цельКатегориальные латентные состоянияЕдиное латентное состояние
Представленные области7: зрение, клетки, клинические данные, управление, молекулы, уравнения в частных производных, погодаПонимание видео, манипуляции роботамиPointMaze, PushT, Wall, деформируемые объектыРазнообразные области RL, фиксированные гиперпараметры104 задачи непрерывного управления, 4 области
Планирование / развёртываниеЛатентное развёртывание, планирование CEMПланирование по целям-изображениямПланирование CEMПолитика на основе развёртываний в воображенииПланирование MPC
Общедоступные контрольные точкиИсследовательские контрольные точки для отдельных областей на HFДа, от 300 млн до 1 млрд (V-JEPA 2)PointMaze, PushT, WallНе указаны в репозиторииБолее 300 контрольных точек, до 317 млн
ЛицензияApache-2.0MIT (некоторые файлы — Apache-2.0)MITMITMIT

Источники: README-файлы GitHub каждого проекта, ссылки на которые приведены в строке заголовка. Статус контрольных точек JEPA-Anything указан в её карточке на Hugging Face. Проверено 5 октября 2026 года.

Главные выводы

  • OPF разделяет 1 цель JEPA на K ортогональных факторов с отдельными предикторами.
  • Она превзошла сопоставимые базовые модели JEPA во всех 10 задачах динамики.
  • Ошибка при единичном вмешательстве в Interventional Pong снизилась на 34.83%.
  • Преимущества в планировании зависят от среды; в Hopper лучшей оказалась стандартная JEPA.
  • Основной код распространяется по лицензии Apache-2.0; исследовательские контрольные точки размещены на Hugging Face.

Ознакомьтесь с статьёй, репозиторием GitHub и контрольными точками моделей. Вся благодарность — исследователям этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту по машинному обучению с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.

Хотите сотрудничать с нами для продвижения вашего репозитория GitHub, страницы на Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости