Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

Contrastive-LM пусна CLM-8B: отворен модел System One, който оценява действията на агенти до 9 пъти по-бързо от Jev

Contrastive-LM пусна CLM-8B — първия отворен модел от нов клас, наречен контрастивни езикови модели (CLM). CLM не генерира текст. Той оценява набор от възможни действия спрямо текущото състояние и връща вероятности. Основният му базов модел е Jev — собственият модел System One на TypeSafe AI.

Може ли да бъде внедрен? Да. Главата с лиценз Apache-2.0 заема 75 MB. Моделът работи на 1 NVIDIA GPU под Linux, като vLLM обслужва енкодера Qwen3-8B.

Какво прави моделът System One

Jev влезе в ограничен ранен достъп на 15 септември 2026 г. Той връща типизирани стойности с вероятности вместо текст. CLM се стреми към същия интерфейс. GitHub хранилището на CLM предоставя CLM-8B чрез API, съвместим с TypeSafe. То поддържа 3 типа въпроси:

  • Noul: връща вероятността дадено твърдение да е вярно.
  • Choice: избира една опция от предварително зададен набор с вероятности.
  • Score: връща очаквано ниво по подредена скала.

Заявка, написана за API на TypeSafe, може да бъде изпълнена отново чрез Python клиента на CLM.

Как работи CLM

CLM обучава енкодер на състоянието и енкодер на действието с двупосочна InfoNCE загуба. Всеки енкодер представлява замразена базова архитектура Qwen3-8B плюс обучаема проекционна глава с 20 млн. параметъра. Обучението приближава всяко състояние към реално изпълненото действие и го отдалечава от останалите.

При инференция CLM оценява всеки кандидат чрез скаларното произведение на векторните представяния на състоянието и действието. Softmax върху тези оценки се превръща в разпределението на отговорите. Същият примитив подрежда най-добрите от N решения, насочва инструменти и отговаря на типизирани решения.

Този дизайн разделя състоянията и действията. В агентен цикъл състоянието се променя на всяка стъпка, докато наборът от действия остава до голяма степен фиксиран. clm-serve заделя блок от GPU памет, подобно на KV кеша на vLLM, и използва повторно кешираните вектори. На 1 RTX 4090 с 3 действия повторно посещаваните състояния намаляват времето си от 1,7 ms на 0,6 ms. Картата на модела отчита, че CLM работи 13× по-бързо от Jev при около 1000 кандидати.

Рецепта за обучение в 3 етапа

  1. Предварително обучение върху ~60 млн. двойки въпрос-отговор от Nemotron DQA.
  2. Междинно обучение върху ~30 млн. синтетични трудни отрицателни примера, генерирани от Gemini 2.5 Flash-Lite.
  3. Дообучение върху ~1 млн. агентни траектории от Agent Data Protocol, Endless-Terminals и LiteCoder-Terminal-SFT.

При ~100 хил. въпроса, отделени за тестване, само предварителното обучение достига 52,1% точност top-1. Междинното обучение я повишава до 69,2%. Обучението върху трудни отрицателни примери от самото начало достига максимум от 62,4%, след което моделът започва да се преобучава.

Резултати с нулев изстрел спрямо Jev

ЗадачаЛатентност на CLM-8BЛатентност на JevУспеваемост на CLM-8BУспеваемост на Jev
Игра T-Rex16,5 ms149,8 ms5/55/5
Извикване на инструменти (BFCL v4)76,8 ms125,5 ms95,2%99,2%
WikiRacing79,8 ms225 ms26/3030/30
Super Mario33,5 ms132,6 ms5/55/5

Данните за 9× идват от играта T-Rex, в която действията се повтарят в различни състояния. CLM се изравнява с Jev при T-Rex и Super Mario. Той изостава при извикването на инструменти и WikiRacing, като същевременно работи по-бързо при всяка задача.

CLM като верификатор за кодиращи агенти

Тук генераторът създава няколко кандидат-решения, а верификаторът избира едно от тях. Opus 5 генерира кандидати за DeepSWE (best-of-4). Fable 5 генерира кандидати за Terminal-Bench 2.1 (best-of-5). Екипът оцени 38 задачи от DeepSWE и 30 задачи от Terminal-Bench 2.1, отделени за тестване. Латентността беше измерена на H100.

БенчмаркPass@1CLM (дообучен)JevЛатентност на CLMЛатентност на Jev
DeepSWE73,7%81,6%71,1%79 ms449 ms
Terminal-Bench 2.184,0%87,6%83,1%32 ms131 ms

Изследователският екип представя тези резултати като нови водещи постижения при верификаторите. Jev постига резултат под pass@1 и при двата бенчмарка, така че изборът с Jev е по-лош от вземането на 1 извадка. CLM работи от 4,1× до 5,7× по-бързо. Тези числа използват леки дообучени глави, а не чекпойнта с нулев изстрел. Това са резултати от отделени подмножества, а не пълни класирания в лидерборд.

Интерактивно обяснение

Основни изводи

  • CLM-8B оценява кандидат-действия вместо да генерира текст.
  • До 9× по-ниска латентност от Jev при тестове с нулев изстрел.
  • Дообучените глави достигат 81,6% при DeepSWE и 87,6% при подмножествата на Terminal-Bench 2.1.
  • Кешираните вектори на състоянията и действията намаляват латентността на агентния цикъл.
  • Глава с лиценз Apache-2.0, хоствана самостоятелно на 1 NVIDIA GPU.

Разгледайте блога, кода и данните и моделите. Цялата заслуга е за изследователя на този проект. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit с над 150 хил. членове за машинно обучение и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.

Имате нужда от партньорство с нас за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face ИЛИ представяне на продукт ИЛИ уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини