Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

Contrastive-LM випустила CLM-8B: відкриту модель System One, що оцінює дії агентів до 9 разів швидше за Jev

Contrastive-LM випустила CLM-8B — першу відкриту модель нового класу, що називається контрастивними мовними моделями (CLM). CLM не генерує текст. Вона оцінює набір можливих дій щодо поточного стану та повертає ймовірності. Її основним базовим орієнтиром є Jev — пропрієтарна модель System One від TypeSafe AI.

Чи придатна вона до розгортання? Так. Головна частина за ліцензією Apache-2.0 важить 75 МБ. Вона працює на 1 GPU NVIDIA під Linux, а обслуговування Qwen3-8B encoder здійснюється через vLLM.

Що робить модель System One

Jev стала доступною для обмеженого раннього доступу 15 вересня 2026 року. Вона повертає типізовані значення з імовірностями замість тексту. CLM орієнтована на той самий інтерфейс. Репозиторій CLM на GitHub надає доступ до CLM-8B через API, сумісний із TypeSafe. Він підтримує 3 типи запитань:

  • Noul: повертає ймовірність того, що твердження є істинним.
  • Choice: обирає один варіант із заданого набору, повертаючи ймовірності.
  • Score: повертає очікуваний рівень за впорядкованою шкалою.

Запит, написаний для API TypeSafe, можна повторно виконати через клієнт CLM для Python.

Як працює CLM

CLM навчає encoder стану та encoder дії за допомогою двонапрямленої функції втрат InfoNCE. Кожен encoder складається із замороженої базової моделі Qwen3-8B і навчуваної проєкційної головки з 20 млн параметрів. Під час навчання кожен стан наближається до фактично виконаної дії та віддаляється від інших дій.

Під час виведення CLM оцінює кожного кандидата за скалярним добутком векторних представлень стану й дії. Softmax над цими оцінками перетворюється на розподіл відповідей. Цей самий примітив ранжує найкращі рішення з N варіантів, маршрутизує інструменти та відповідає на типізовані запити.

Ця конструкція розділяє стани й дії. У циклі роботи агента стан змінюється на кожному кроці, тоді як набір дій здебільшого залишається незмінним. clm-serve резервує ділянку пам’яті GPU, подібно до KV-кешу vLLM, і повторно використовує кешовані вектори. На 1 RTX 4090 із 3 діями повторно відвідувані стани скорочують час обробки з 1,7 мс до 0,6 мс. У картці моделі зазначено, що CLM працює у 13 разів швидше за Jev приблизно з 1 000 кандидатами.

Рецепт навчання у 3 етапи

  1. Попереднє навчання на приблизно 60 млн пар запитань і відповідей Nemotron DQA.
  2. Проміжне навчання на приблизно 30 млн синтетичних складних негативних прикладів, згенерованих Gemini 2.5 Flash-Lite.
  3. Післянавчання на приблизно 1 млн траєкторій агентів із Agent Data Protocol, Endless-Terminals і LiteCoder-Terminal-SFT.

На приблизно 100 тис. відкладених запитань одне лише попереднє навчання забезпечує точність top-1 на рівні 52,1%. Проміжне навчання підвищує її до 69,2%. Навчання на складних негативних прикладах із самого початку дає максимум 62,4%, після чого модель перенавчається.

Результати в режимі zero-shot у порівнянні з Jev

ЗавданняЗатримка CLM-8BЗатримка JevУспішність CLM-8BУспішність Jev
Гра T-Rex16,5 мс149,8 мс5/55/5
Виклик інструментів (BFCL v4)76,8 мс125,5 мс95,2%99,2%
WikiRacing79,8 мс225 мс26/3030/30
Super Mario33,5 мс132,6 мс5/55/5

Показник у 9 разів походить із гри T-Rex, де дії повторюються в різних станах. CLM відповідає Jev у T-Rex і Super Mario. Вона поступається в задачах виклику інструментів і WikiRacing, водночас працюючи швидше в кожному завданні.

CLM як верифікатор для агентів програмування

У цьому випадку генератор створює кілька можливих рішень, а верифікатор обирає одне з них. Opus 5 створила кандидатні рішення DeepSWE (best-of-4). Fable 5 створила кандидатні рішення Terminal-Bench 2.1 (best-of-5). Команда оцінила 38 відкладених завдань DeepSWE і 30 відкладених завдань Terminal-Bench 2.1. Затримку вимірювали на H100.

БенчмаркPass@1CLM (дообучена)JevЗатримка CLMЗатримка Jev
DeepSWE73,7%81,6%71,1%79 мс449 мс
Terminal-Bench 2.184,0%87,6%83,1%32 мс131 мс

Дослідницька команда повідомляє про ці результати як про нові найкращі результати для верифікаторів. Показники Jev нижчі за pass@1 в обох бенчмарках, тож вибір за допомогою Jev гірший, ніж використання 1 зразка. CLM працює у 4,1–5,7 раза швидше. У цих показниках використано легкі дообучені головки, а не zero-shot чекпойнт. Це результати на підмножинах відкладених даних, а не повні результати для таблиць лідерів.

Інтерактивне пояснення

Ключові висновки

  • CLM-8B оцінює можливі дії замість генерування тексту.
  • У тестах zero-shot затримка до 9 разів нижча, ніж у Jev.
  • Дообучені головки досягають 81,6% на DeepSWE та 87,6% на підмножинах Terminal-Bench 2.1.
  • Кешовані вектори станів і дій скорочують затримку в циклі роботи агента.
  • Головка за ліцензією Apache-2.0, самостійне розгортання на 1 GPU NVIDIA.

Відвідайте блог, код і дані та моделі. Уся подяка належить досліднику цього проєкту. Також не соромтеся підписатися на нас у Twitter і не забудьте приєднатися до нашого сабреддіту ML із понад 150 тис. учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.

Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки на Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини