Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Contrastive-LM выпустила CLM-8B: открытую модель System One, оценивающую действия агентов до 9 раз быстрее, чем Jev

Contrastive-LM выпустила CLM-8B — первую открытую модель нового класса под названием Contrastive Language Models (CLM). CLM не генерирует текст. Она оценивает набор возможных действий относительно текущего состояния и возвращает вероятности. Основным базовым решением для сравнения служит Jev — проприетарная модель System One от TypeSafe AI.

Можно ли её развернуть? Да. Голова под лицензией Apache-2.0 занимает 75 МБ. Модель работает на 1 графическом процессоре NVIDIA под управлением Linux, а для обслуживания энкодера Qwen3-8B используется vLLM.

Что делает модель System One

Jev стала доступна ограниченному числу пользователей в рамках раннего доступа 15 сентября 2026 года. Она возвращает типизированные значения с вероятностями вместо текста. CLM ориентирована на тот же интерфейс. Репозиторий CLM на GitHub предоставляет CLM-8B через API, совместимый с TypeSafe. Он поддерживает 3 типа вопросов:

  • Noul: возвращает вероятность истинности утверждения.
  • Choice: выбирает один вариант из объявленного набора с указанием вероятностей.
  • Score: возвращает ожидаемый уровень по упорядоченной шкале.

Запрос, написанный для API TypeSafe, можно повторно выполнить через Python-клиент CLM.

Как работает CLM

CLM обучает энкодер состояния и энкодер действия с помощью двунаправленной функции потерь InfoNCE. Каждый энкодер представляет собой замороженную основу Qwen3-8B и обучаемую проекционную голову с 20 млн параметров. В ходе обучения каждое состояние приближается к фактически выполненному действию и отдаляется от остальных.

Во время вывода CLM оценивает каждого кандидата по скалярному произведению эмбеддингов состояния и действия. Применение softmax к этим оценкам превращает их в распределение ответов. Этот же примитив ранжирует решения best-of-N, маршрутизирует инструменты и отвечает на типизированные запросы.

Такая архитектура разделяет состояния и действия. В цикле работы агента состояние меняется на каждом шаге, тогда как набор действий остаётся в основном неизменным. clm-serve резервирует область памяти GPU, аналогично KV-кэшу vLLM, и повторно использует кэшированные векторы. На 1 RTX 4090 с 3 действиями повторно посещаемые состояния обрабатываются за 0,6 мс вместо 1,7 мс. В карточке модели сообщается, что CLM работает в 13 раз быстрее Jev примерно при 1 000 кандидатах.

Рецепт обучения из 3 этапов

  1. Предварительное обучение на примерно 60 млн пар вопросов и ответов Nemotron DQA.
  2. Промежуточное обучение на примерно 30 млн синтетических сложных отрицательных примеров, сгенерированных Gemini 2.5 Flash-Lite.
  3. Дообучение на примерно 1 млн траекторий агентов из Agent Data Protocol, Endless-Terminals и LiteCoder-Terminal-SFT.

На примерно 100 тыс. отложенных вопросов одно лишь предварительное обучение обеспечивает точность top-1 на уровне 52,1%. Промежуточное обучение повышает её до 69,2%. Обучение на сложных отрицательных примерах с самого начала даёт максимум 62,4%, после чего модель переобучается.

Результаты в режиме zero-shot в сравнении с Jev

ЗадачаЗадержка CLM-8BЗадержка JevУспешность CLM-8BУспешность Jev
Игра T-Rex16,5 мс149,8 мс5/55/5
Вызов инструментов (BFCL v4)76,8 мс125,5 мс95,2%99,2%
WikiRacing79,8 мс225 мс26/3030/30
Super Mario33,5 мс132,6 мс5/55/5

Показатель 9× получен в игре T-Rex, где действия повторяются в разных состояниях. CLM соответствует Jev в T-Rex и Super Mario. В задачах вызова инструментов и WikiRacing она уступает, при этом работает быстрее на каждой задаче.

CLM как верификатор для агентов программирования

В этом случае генератор создаёт несколько решений-кандидатов, а верификатор выбирает одно из них. Opus 5 создавала кандидатов DeepSWE (best-of-4). Fable 5 создавала кандидатов Terminal-Bench 2.1 (best-of-5). Команда оценила 38 отложенных задач DeepSWE и 30 отложенных задач Terminal-Bench 2.1. Задержка измерялась на H100.

БенчмаркPass@1CLM (дообученная)JevЗадержка CLMЗадержка Jev
DeepSWE73,7%81,6%71,1%79 мс449 мс
Terminal-Bench 2.184,0%87,6%83,1%32 мс131 мс

Исследовательская команда сообщает, что это новые лучшие результаты среди верификаторов (SOTA). На обоих бенчмарках Jev показывает результат ниже pass@1, поэтому выбор с помощью Jev хуже, чем получение одной выборки. CLM работает в 4,1–5,7 раза быстрее. Эти показатели получены с использованием лёгких дообученных голов, а не контрольной точки zero-shot. Это результаты на отложенных подмножествах, а не полные заявки для таблиц лидеров.

Интерактивное объяснение

Основные выводы

  • CLM-8B оценивает возможные действия вместо генерации текста.
  • Задержка до 9 раз ниже, чем у Jev, в тестах zero-shot.
  • Дообученные головы достигают 81,6% на DeepSWE и 87,6% на подмножествах Terminal-Bench 2.1.
  • Кэширование векторов состояний и действий сокращает задержку в цикле работы агента.
  • Голова под лицензией Apache-2.0, самостоятельное развёртывание на 1 графическом процессоре NVIDIA.

Посетите блог, код и раздел данных и моделей. Вся заслуга принадлежит исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту ML с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь к нам можно присоединиться и в Telegram.

Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы на Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости