Contrastive-LM пусна CLM-8B: отворен модел System One, който оценява действията на агенти до 9 пъти по-бързо от Jev
Contrastive-LM пусна CLM-8B — първия отворен модел от нов клас, наречен контрастивни езикови модели (CLM). CLM не генерира текст. Той оценява набор от възможни действия спрямо текущото състояние и връща вероятности. Основният му базов модел е Jev — собственият модел System One на TypeSafe AI.
Може ли да бъде внедрен? Да. Главата с лиценз Apache-2.0 заема 75 MB. Моделът работи на 1 NVIDIA GPU под Linux, като vLLM обслужва енкодера Qwen3-8B.
Какво прави моделът System One
Jev влезе в ограничен ранен достъп на 15 септември 2026 г. Той връща типизирани стойности с вероятности вместо текст. CLM се стреми към същия интерфейс. GitHub хранилището на CLM предоставя CLM-8B чрез API, съвместим с TypeSafe. То поддържа 3 типа въпроси:
- Noul: връща вероятността дадено твърдение да е вярно.
- Choice: избира една опция от предварително зададен набор с вероятности.
- Score: връща очаквано ниво по подредена скала.
Заявка, написана за API на TypeSafe, може да бъде изпълнена отново чрез Python клиента на CLM.
Как работи CLM
CLM обучава енкодер на състоянието и енкодер на действието с двупосочна InfoNCE загуба. Всеки енкодер представлява замразена базова архитектура Qwen3-8B плюс обучаема проекционна глава с 20 млн. параметъра. Обучението приближава всяко състояние към реално изпълненото действие и го отдалечава от останалите.
При инференция CLM оценява всеки кандидат чрез скаларното произведение на векторните представяния на състоянието и действието. Softmax върху тези оценки се превръща в разпределението на отговорите. Същият примитив подрежда най-добрите от N решения, насочва инструменти и отговаря на типизирани решения.
Този дизайн разделя състоянията и действията. В агентен цикъл състоянието се променя на всяка стъпка, докато наборът от действия остава до голяма степен фиксиран. clm-serve заделя блок от GPU памет, подобно на KV кеша на vLLM, и използва повторно кешираните вектори. На 1 RTX 4090 с 3 действия повторно посещаваните състояния намаляват времето си от 1,7 ms на 0,6 ms. Картата на модела отчита, че CLM работи 13× по-бързо от Jev при около 1000 кандидати.
Рецепта за обучение в 3 етапа
- Предварително обучение върху ~60 млн. двойки въпрос-отговор от Nemotron DQA.
- Междинно обучение върху ~30 млн. синтетични трудни отрицателни примера, генерирани от Gemini 2.5 Flash-Lite.
- Дообучение върху ~1 млн. агентни траектории от Agent Data Protocol, Endless-Terminals и LiteCoder-Terminal-SFT.
При ~100 хил. въпроса, отделени за тестване, само предварителното обучение достига 52,1% точност top-1. Междинното обучение я повишава до 69,2%. Обучението върху трудни отрицателни примери от самото начало достига максимум от 62,4%, след което моделът започва да се преобучава.
Резултати с нулев изстрел спрямо Jev
| Задача | Латентност на CLM-8B | Латентност на Jev | Успеваемост на CLM-8B | Успеваемост на Jev |
|---|---|---|---|---|
| Игра T-Rex | 16,5 ms | 149,8 ms | 5/5 | 5/5 |
| Извикване на инструменти (BFCL v4) | 76,8 ms | 125,5 ms | 95,2% | 99,2% |
| WikiRacing | 79,8 ms | 225 ms | 26/30 | 30/30 |
| Super Mario | 33,5 ms | 132,6 ms | 5/5 | 5/5 |
Данните за 9× идват от играта T-Rex, в която действията се повтарят в различни състояния. CLM се изравнява с Jev при T-Rex и Super Mario. Той изостава при извикването на инструменти и WikiRacing, като същевременно работи по-бързо при всяка задача.
CLM като верификатор за кодиращи агенти
Тук генераторът създава няколко кандидат-решения, а верификаторът избира едно от тях. Opus 5 генерира кандидати за DeepSWE (best-of-4). Fable 5 генерира кандидати за Terminal-Bench 2.1 (best-of-5). Екипът оцени 38 задачи от DeepSWE и 30 задачи от Terminal-Bench 2.1, отделени за тестване. Латентността беше измерена на H100.
| Бенчмарк | Pass@1 | CLM (дообучен) | Jev | Латентност на CLM | Латентност на Jev |
|---|---|---|---|---|---|
| DeepSWE | 73,7% | 81,6% | 71,1% | 79 ms | 449 ms |
| Terminal-Bench 2.1 | 84,0% | 87,6% | 83,1% | 32 ms | 131 ms |
Изследователският екип представя тези резултати като нови водещи постижения при верификаторите. Jev постига резултат под pass@1 и при двата бенчмарка, така че изборът с Jev е по-лош от вземането на 1 извадка. CLM работи от 4,1× до 5,7× по-бързо. Тези числа използват леки дообучени глави, а не чекпойнта с нулев изстрел. Това са резултати от отделени подмножества, а не пълни класирания в лидерборд.
Интерактивно обяснение
Основни изводи
- CLM-8B оценява кандидат-действия вместо да генерира текст.
- До 9× по-ниска латентност от Jev при тестове с нулев изстрел.
- Дообучените глави достигат 81,6% при DeepSWE и 87,6% при подмножествата на Terminal-Bench 2.1.
- Кешираните вектори на състоянията и действията намаляват латентността на агентния цикъл.
- Глава с лиценз Apache-2.0, хоствана самостоятелно на 1 NVIDIA GPU.
Разгледайте блога, кода и данните и моделите. Цялата заслуга е за изследователя на този проект. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit с над 150 хил. членове за машинно обучение и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.
Имате нужда от партньорство с нас за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face ИЛИ представяне на продукт ИЛИ уебинар и т.н.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.