Sakhanda Wire
NVDA $233.95 +1.34% MSFT $517.53 +0.92% GOOGL $343.50 +1.56% META $728.08 +0.30% AMZN $251.52 +1.33%
← До новин

Пояснення моделей Decision AI: TypeSafe Jev проти Fastino GLiDE, GLiNER2.5-Decide та конкурентів із відкритим кодом

Що таке моделі Decision AI?

Моделі Decision AI — це новий клас моделей, які повертають рішення, а не абзац тексту. Ви надсилаєте текст із типізованими запитаннями. Модель повертає варіанти, оцінки або ймовірності «так/ні», на основі яких ваш код може безпосередньо виконувати розгалуження.

Категорія стала популярною, коли TypeSafe AI представила Jev після 2 років роботи в режимі секретності. TypeSafe називає її «моделлю Системи 1» — на честь швидкого, інтуїтивного мислення Системи 1 Даніеля Канемана.

Протягом 3 тижнів Fastino Labs випустила 2 конкуруючі моделі, а розробники відкритого коду опублікували кілька відтворень у стилі Jev. У цій статті розглядається принцип роботи категорії, сфери її застосування та порівняння доступних варіантів.

Як працює Jev

Jev приймає «стан» (рядок, масив або набір пар «ім’я-значення») і одне чи кілька запитань. Згідно з документацією TypeSafe, вона підтримує 3 примітиви:

  • Choice: вибір одного варіанта зі списку з імовірностями та рівнем впевненості. TypeSafe зазначає, що Jev підтримує до 255 варіантів.
  • Score: оцінювання стану за шкалою впорядкованих рівнів з імовірностями та рівнем впевненості.
  • Noul: імовірність від 0 до 1 того, що твердження є правдивим. Назва є скороченням від Bernoulli.

Кожне запитання оцінюється паралельно й незалежно щодо того самого стану. Додавання запитань майже не змінює час відповіді. Оскільки Jev ніколи не генерує рядки, TypeSafe стверджує, що вона не може повернути помилку типу.

За словами TypeSafe, під капотом працюють нова архітектура, паралельний семплер і метод навчання під назвою Reinforcement Learning for Calibrated Decisions (RLCD). RLHF оптимізує модель під людські уподобання. RLCD оптимізує калібровані ймовірності, за яких вища впевненість має означати вищу точність.

Ціна — це ключовий фактор, за яким варто стежити. Jev коштує $0.042 за мільйон вхідних токенів, а вихідні токени безкоштовні. OpenRouter вказує на контекстне вікно обсягом 32K. TypeSafe повідомляє про наскрізний час відповіді від 70 до 500 мілісекунд.

Інтерактивне пояснення

Бенчмарки: що показують оцінювання робочих процесів TypeSafe

TypeSafe створила оцінювання робочих процесів для 4 завдань: інцидентів безпеки, спостережуваності трас агентів, обробки рахунків і обслуговування клієнтів. Еталонні мітки отримано шляхом усереднення результатів GPT-6 Astra і Claude Fable 5.1 у режимі поглибленого міркування.

  • Jev: середня точність 67.8%, $0.0004 за випадок, 0.4 секунди.
  • Claude Sonnet 5 (той самий робочий процес): 67.8%, $0.1174 за випадок, 78.1 секунди.
  • Найкраща порівнювана модель (OpenAI «sol»): 74.1%, $0.0836 за випадок, 23.3 секунди.

Jev досягла такої самої точності, як Sonnet 5, за частку його вартості й затримки. Водночас вона все ще відстає від найкращої конфігурації передових моделей на 6.3 пункта. За окремими завданнями Jev набрала 76.0% в обслуговуванні клієнтів, але лише 61.8% в обробці рахунків.

Варіанти використання: де доречні моделі рішень

Емпіричне правило просте. Якщо вашому коду потрібна обмежена відповідь, на основі якої він виконуватиме розгалуження, модель рішень може бути підходящим варіантом. Якщо результат має прочитати людина, використовуйте LLM.

Керування потоком роботи агента

  • Вибір наступного інструмента або субагента: Vercel називає це основним варіантом використання.
  • Продовжити, повторити спробу, запитати користувача або зупинитися: одне запитання Choice замінює ненадійний етап аналізу JSON.
  • Маршрутизація моделей: надсилайте прості запити дешевій моделі, а складні — передовій моделі. Fastino називає маршрутизацію за призначенням, складністю або рівнем ескалації.

Класифікація та тріаж

  • Маршрутизація заявок до служби підтримки, сортування електронних листів і визначення намірів: ці завдання становлять значну частину бенчмарку Fastino на 17 наборах даних.
  • Виявлення спаму, пропозиції міток і визначення пріоритетів: Саймон Віллісон називає їх природними завданнями для класифікації.
  • Тріаж сповіщень безпеки: найпростіший опублікований робочий процес TypeSafe визначає, чи закрити сповіщення, передати його аналітику або ізолювати загрозу.

Перевірка та безпека

  • Захисні обмеження та виявлення джейлбрейків: TypeSafe пропонує Jev для оцінювання запитів, трас міркувань і результатів.
  • Об’єднані перевірки безпеки: GLiNER2.5-Decide може одночасно декодувати «безпеку» та «тип шкоди», щоб відповіді ніколи не суперечили одна одній.
  • Перевірені каскади: посібник Jev від OpenRouter описує створення чернетки дешевою моделлю, перевірку за допомогою Jev і ескалацію лише в разі невдачі.

Оцінювання та спостережуваність

  • Заміна оцінювача LLM-as-a-judge: Arize і Langfuse тепер запускають оцінювачі Jev на трасах.
  • Обмеження CI/CD: Buddy дає змогу конвеєрам оцінювати, класифікувати або блокувати запуски за допомогою дії Jev.

Пошук і обробка даних

  • Переранжування: оцінюйте 100 кандидатів BM25 на релевантність за один паралельний виклик.
  • Map-reduce для великих наборів даних: TypeSafe пропонує перетворювати масиви даних на ознаки за низькою ціною.
  • Обрізання контексту: Fastino називає вибір контексту, який слід зберегти перед викликом LLM.

Застосунки реального часу

  • Ігри та симуляції: TypeSafe демонструвала, як Jev грає в Doom і Wikiracing.
  • Інтерфейси з критичною затримкою: рішення менш ніж за секунду роблять ШІ придатним для використання в інтерактивних процесах.

Коли не варто використовувати модель рішень

  • Вам потрібні згенерований текст, резюме або пояснення.
  • Завдання потребує точної арифметики, підрахунку або обчислень із датами. У посібнику TypeSafe щодо нерівностей Jev 1.13 зазначено всі 3 обмеження.
  • Рішення впливає на засоби до існування людей, наприклад під час найму. Віллісон попереджає, що приховане упередження важко перевірити.

Практичні приклади: де моделі рішень уже працюють

1. Використання Vercel AI Gateway

Vercel повідомляє, що Jev стала моделлю, яку найшвидше впроваджували за всю історію AI Gateway. Протягом 24 годин її використовували майже 13% платних команд. Це вдвічі більше за частку сімейства GPT-5.6 і більш ніж у 6 разів більше за частку Fable 5.1.

2. Переранжування пошуку

Саймон Віллісон отримав 100 кандидатів за допомогою BM25, а потім доручив Jev оцінити релевантність кожного. Цей підхід замінює дорогий переранжувальник на основі LLM дешевими паралельними запитаннями Score.

3. Конвеєри оцінювання LLM

Arize і Langfuse випустили оцінювачі Jev-as-a-judge. Langfuse називає цю функцію «оцінювачами моделей рішень», щоб згодом можна було додавати інші моделі. Підтримка Jev у Langfuse все ще позначена як експериментальна.

4. Оркестрація периферійної мережі 6G

У новій статті на arXiv Jev використовували для інтерпретації угод про обслуговування на периферії мережі. За однакової точності Jev скоротила медіанну затримку прийняття рішень на 22.4% порівняно з DeepSeek і на 61.9% порівняно з Gemini.

5. Ігрові агенти реального часу

У демонстрації Doom від TypeSafe Jev виконувала 10 запитів на секунду. Команда оцінила вартість приблизно в $7 на годину.

Конкурентне середовище: порівняння 7 моделей рішень

У таблиці нижче розглянуто Jev, її найближчого комерційного конкурента та провідні варіанти з відкритими вагами. Усі характеристики взято зі сторінки релізу або картки моделі відповідного проєкту.

МодельРозробникЛіцензія / доступРозмір і архітектураТипи запитаньЗаявлена затримкаПрацює локально
Jev 1.13TypeSafe AIЗакрита; розміщений API за ціною $0.042/M вхідних токенів, вихідні безкоштовніНе розкривається; нова архітектура, паралельний семплер, RLCDChoice, Score, Noul (до 255 варіантів)70–500 мсНі
GLiDEFastino LabsЗакрита; API Fastino, контекст 40KНе розкривається; адаптивне міркування для невизначених випадківВибрана дія, впевненість та ймовірності варіантівНе розкриваєтьсяНі
GLiNER2.5-DecideFastino LabsВідкриті ваги Apache 2.0; також доступна в API FastinoКодер DeBERTa-v3-large на 340M параметрівТипізовані рішення зі спільними обмеженнями, а також spans і зв’язки38.3 мс p50 (V100), 167.3 мс (CPU з 48 vCPU)Так, CPU або GPU
LayaConvai InnovationsВідкриті ваги Apache 2.0421M ModernBERT-large (англійська); 322M mmBERT-base (багатомовна)Choice, Score, Noul; понад 100 мов~33 мс на запитання на GPUТак
JevK5Незалежний розробникВідкриті ваги Apache 2.04B, Qwen3.5-4B зі злитою LoRAЙмовірність для кожного варіанта за один прохідНе зазначеноТак, GPU
OpenJevTheo LeeMITЗаморожена Qwen3.5-4B, зчитує логіти варіантівТипізовані варіанти за один прохідУ 5.21 раза швидша за авторегресивний JSONТак, споживча GPU
kev-0.5bJared PalmerApache 2.0 (базова модель під ліцензією Qwen)LoRA плюс readout head на Qwen2.5-0.5B; API, сумісний із JevNoul, Choice (2–255), Score~160 мс для 6 запитань (Apple M5)Так, ноутбук
Загальна LLM + структурований вивідБагатоПереважно закриті; вхідні та вихідні токениАвторегресивний декодерБудь-які, у вигляді згенерованого текстуЗазвичай секундиЗалежить

Показники прямого порівняння (власний бенчмарк кожного постачальника)

Ці оцінки отримано з різних наборів тестів. Не порівнюйте показники між рядками.

Бенчмарк (за даними)Результати
Оцінювання робочих процесів (TypeSafe)Jev 67.8%, Sonnet 5 67.8%, найкраща LLM 74.1%
Decision Index 0.2.1 (Fastino)GLiDE 64.81, Jev 57.91
Точність CLadder (Fastino)GLiDE 88.7%, Jev 72.6%
Точність CRUXEval (Fastino)GLiDE 92.6%, Jev 73.0%
Fast Decisions, 17 наборів даних (Fastino)GLiNER2.5-Decide 60.1%, JevK5 57.5%, SemIf 56.4%, GLiFormer 49.0%, Laya 46.6%
Підмножина оцінювання TypeSafe на 102 рядки (OpenJev)Jev 0.883, OpenJev 0.845 збалансованої точності

Тут важливі два застереження. Fastino самостійно обрала і тести, і суперників для заяв щодо GLiDE та GLiNER2.5-Decide. У порівнянні Fast Decisions також використовується JevK5, відтворення з відкритим кодом, а не Jev від TypeSafe.

Як обрати

  • Оберіть Jev для керованого API із найширшою екосистемою підтримки на сьогодні.
  • Оберіть GLiDE, щоб тестувати складніші рішення, що потребують міркування, і перевірити заяви Fastino на власних даних.
  • Оберіть GLiNER2.5-Decide для розгортання в ізольованому середовищі, донавчання або відповідей, які мають дотримуватися правил між запитаннями.
  • Оберіть Laya для багатомовних рішень або дуже низької затримки на запитання.
  • Оберіть kev, OpenJev або JevK5, щоб експериментувати локально або уникнути залежності від постачальника.

Чому моделі рішень — останній тренд у ШІ

Ця ідея не нова. Класифікатори та переранжувальники роками приймали рішення. Decision Transformer (2021) представила навчання з підкріпленням як моделювання послідовностей. Gato від DeepMind (2022) продемонструвала, як одна універсальна модель виконує різні завдання. У дослідженні 2023 року «великі моделі рішень» навіть назвали наступним кроком.

У 2026 році змінилася упаковка цієї ідеї. Зсув спричинили 4 фактори:

  • Агентам потрібні дешеві оцінки: маршрутизація, вибір інструментів і захисні обмеження виконуються тисячі разів за один робочий процес. Оплата передових тарифів за кожну таку операцію не масштабується.
  • Калібрування уможливлює автоматизацію: оцінка впевненості дає коду змогу діяти самостійно за достатньої впевненості та передавати завдання на ескалацію, якщо її недостатньо.
  • Екосистема швидко розвивалася: протягом кількох тижнів Jev з’явилася у Vercel, OpenRouter, Arize, Langfuse та Buddy.
  • Конкуренція виникла одразу: Fastino випустила GLiNER2.5-Decide 24 вересня, а GLiDE — 30 вересня. Паралельно з’явилися відкриті відтворення, зокрема kev, OpenJev і JevK5.

Ключові висновки

  • Моделі Decision AI повертають типізовані відповіді з імовірностями, а не згенерований текст.
  • Jev коштує $0.042 за мільйон вхідних токенів, а вихідні токени безкоштовні.
  • В оцінюваннях TypeSafe Jev досягла такої самої точності, як Sonnet 5, за 0.4 секунди на випадок.
  • GLiDE і GLiNER2.5-Decide від Fastino очолюють поле конкурентів, яке швидко розширюється.
  • Використовуйте моделі рішень для маршрутизації та оцінювання, а LLM — для міркування й написання текстів.

FAQ

  • Чи є модель рішень тим самим, що й LLM? Відповідь — ні. Модель рішень читає текст, як LLM, але виводить імовірності для заздалегідь визначених відповідей. Вона не може писати, узагальнювати або пояснювати.
  • Коли слід використовувати модель рішень замість LLM? Використовуйте її для високочастотних обмежених оцінок: класифікації, маршрутизації, тріажу, захисних обмежень, переранжування та оцінювання. LLM залиште для відкритого міркування та генерації.
  • Чи можна запустити модель рішень на власному обладнанні? Jev і GLiDE доступні лише через API. GLiNER2.5-Decide, Laya, JevK5, OpenJev і kev мають відкриті ваги, які можна запускати локально.
  • Хто є головним конкурентом Jev? Fastino Labs — її найпряміший комерційний конкурент. Компанія постачає GLiDE як розміщений API, а GLiNER2.5-Decide — як модель із відкритими вагами.

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини