Contrastive-LM выпустила CLM-8B: открытую модель System One, оценивающую действия агентов до 9 раз быстрее, чем Jev
Contrastive-LM выпустила CLM-8B — первую открытую модель нового класса под названием Contrastive Language Models (CLM). CLM не генерирует текст. Она оценивает набор возможных действий относительно текущего состояния и возвращает вероятности. Основным базовым решением для сравнения служит Jev — проприетарная модель System One от TypeSafe AI.
Можно ли её развернуть? Да. Голова под лицензией Apache-2.0 занимает 75 МБ. Модель работает на 1 графическом процессоре NVIDIA под управлением Linux, а для обслуживания энкодера Qwen3-8B используется vLLM.
Что делает модель System One
Jev стала доступна ограниченному числу пользователей в рамках раннего доступа 15 сентября 2026 года. Она возвращает типизированные значения с вероятностями вместо текста. CLM ориентирована на тот же интерфейс. Репозиторий CLM на GitHub предоставляет CLM-8B через API, совместимый с TypeSafe. Он поддерживает 3 типа вопросов:
- Noul: возвращает вероятность истинности утверждения.
- Choice: выбирает один вариант из объявленного набора с указанием вероятностей.
- Score: возвращает ожидаемый уровень по упорядоченной шкале.
Запрос, написанный для API TypeSafe, можно повторно выполнить через Python-клиент CLM.
Как работает CLM
CLM обучает энкодер состояния и энкодер действия с помощью двунаправленной функции потерь InfoNCE. Каждый энкодер представляет собой замороженную основу Qwen3-8B и обучаемую проекционную голову с 20 млн параметров. В ходе обучения каждое состояние приближается к фактически выполненному действию и отдаляется от остальных.
Во время вывода CLM оценивает каждого кандидата по скалярному произведению эмбеддингов состояния и действия. Применение softmax к этим оценкам превращает их в распределение ответов. Этот же примитив ранжирует решения best-of-N, маршрутизирует инструменты и отвечает на типизированные запросы.
Такая архитектура разделяет состояния и действия. В цикле работы агента состояние меняется на каждом шаге, тогда как набор действий остаётся в основном неизменным. clm-serve резервирует область памяти GPU, аналогично KV-кэшу vLLM, и повторно использует кэшированные векторы. На 1 RTX 4090 с 3 действиями повторно посещаемые состояния обрабатываются за 0,6 мс вместо 1,7 мс. В карточке модели сообщается, что CLM работает в 13 раз быстрее Jev примерно при 1 000 кандидатах.
Рецепт обучения из 3 этапов
- Предварительное обучение на примерно 60 млн пар вопросов и ответов Nemotron DQA.
- Промежуточное обучение на примерно 30 млн синтетических сложных отрицательных примеров, сгенерированных Gemini 2.5 Flash-Lite.
- Дообучение на примерно 1 млн траекторий агентов из Agent Data Protocol, Endless-Terminals и LiteCoder-Terminal-SFT.
На примерно 100 тыс. отложенных вопросов одно лишь предварительное обучение обеспечивает точность top-1 на уровне 52,1%. Промежуточное обучение повышает её до 69,2%. Обучение на сложных отрицательных примерах с самого начала даёт максимум 62,4%, после чего модель переобучается.
Результаты в режиме zero-shot в сравнении с Jev
| Задача | Задержка CLM-8B | Задержка Jev | Успешность CLM-8B | Успешность Jev |
|---|---|---|---|---|
| Игра T-Rex | 16,5 мс | 149,8 мс | 5/5 | 5/5 |
| Вызов инструментов (BFCL v4) | 76,8 мс | 125,5 мс | 95,2% | 99,2% |
| WikiRacing | 79,8 мс | 225 мс | 26/30 | 30/30 |
| Super Mario | 33,5 мс | 132,6 мс | 5/5 | 5/5 |
Показатель 9× получен в игре T-Rex, где действия повторяются в разных состояниях. CLM соответствует Jev в T-Rex и Super Mario. В задачах вызова инструментов и WikiRacing она уступает, при этом работает быстрее на каждой задаче.
CLM как верификатор для агентов программирования
В этом случае генератор создаёт несколько решений-кандидатов, а верификатор выбирает одно из них. Opus 5 создавала кандидатов DeepSWE (best-of-4). Fable 5 создавала кандидатов Terminal-Bench 2.1 (best-of-5). Команда оценила 38 отложенных задач DeepSWE и 30 отложенных задач Terminal-Bench 2.1. Задержка измерялась на H100.
| Бенчмарк | Pass@1 | CLM (дообученная) | Jev | Задержка CLM | Задержка Jev |
|---|---|---|---|---|---|
| DeepSWE | 73,7% | 81,6% | 71,1% | 79 мс | 449 мс |
| Terminal-Bench 2.1 | 84,0% | 87,6% | 83,1% | 32 мс | 131 мс |
Исследовательская команда сообщает, что это новые лучшие результаты среди верификаторов (SOTA). На обоих бенчмарках Jev показывает результат ниже pass@1, поэтому выбор с помощью Jev хуже, чем получение одной выборки. CLM работает в 4,1–5,7 раза быстрее. Эти показатели получены с использованием лёгких дообученных голов, а не контрольной точки zero-shot. Это результаты на отложенных подмножествах, а не полные заявки для таблиц лидеров.
Интерактивное объяснение
Основные выводы
- CLM-8B оценивает возможные действия вместо генерации текста.
- Задержка до 9 раз ниже, чем у Jev, в тестах zero-shot.
- Дообученные головы достигают 81,6% на DeepSWE и 87,6% на подмножествах Terminal-Bench 2.1.
- Кэширование векторов состояний и действий сокращает задержку в цикле работы агента.
- Голова под лицензией Apache-2.0, самостоятельное развёртывание на 1 графическом процессоре NVIDIA.
Посетите блог, код и раздел данных и моделей. Вся заслуга принадлежит исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту ML с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь к нам можно присоединиться и в Telegram.
Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы на Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.