Sakhanda Wire
NVDA $233.95 +1.34% MSFT $517.53 +0.92% GOOGL $343.50 +1.56% META $728.08 +0.30% AMZN $251.52 +1.33%
← Към новините

Обяснение на Decision AI моделите: TypeSafe Jev срещу Fastino GLiDE, GLiNER2.5-Decide и конкурентите с отворен код

Какво представляват моделите за решения с изкуствен интелект?

Моделите за решения с изкуствен интелект са нов клас модели, които връщат решение, а не абзац. Изпращате текст с типизирани въпроси. Моделът връща избори, оценки или вероятности „да/не“, на които кодът ви може директно да разклони изпълнението.

Категорията навлезе в мейнстрийма, когато TypeSafe AI представи Jev след 2 години в режим на секретност. TypeSafe го нарича „модел System One“, по аналогия с бързото, интуитивно мислене System 1 на Даниел Канеман.

В рамките на 3 седмици Fastino Labs пусна 2 конкурентни модела, а разработчици на софтуер с отворен код публикуваха няколко репродукции в стила на Jev. Тази статия разглежда как работи категорията, къде намира приложение и как се сравняват различните възможности.

Как работи Jev

Jev приема „състояние“ (низ, масив или набор от двойки име-стойност) и един или повече въпроси. Според документацията на TypeSafe, той поддържа 3 примитива:

  • Choice: избор на една опция от списък, с вероятности и увереност. TypeSafe посочва, че Jev поддържа до 255 опции.
  • Score: оценяване на състоянието по рубрика с подредени нива, с вероятности и увереност.
  • Noul: вероятност от 0 до 1, че дадено твърдение е вярно. Името е съкращение от Bernoulli.

Всеки въпрос се оценява паралелно и независимо спрямо едно и също състояние. Добавянето на въпроси почти не променя времето за отговор. Тъй като Jev никога не генерира низове, TypeSafe твърди, че той не може да върне грешка в типа.

Под капака TypeSafe описва нова архитектура, паралелен семплер и метод за обучение, наречен Reinforcement Learning for Calibrated Decisions (RLCD). RLHF оптимизира за човешко предпочитание. RLCD оптимизира за калибрирани вероятности, при които по-високата увереност трябва да означава по-висока точност.

Ценообразуването е основното, което трябва да се следи. Jev струва $0.042 на милион входни токени, а изходът е безплатен. OpenRouter посочва контекстен прозорец от 32K. TypeSafe отчита отговори от край до край за 70 до 500 милисекунди.

Интерактивно обяснение

Бенчмаркове: какво показват оценките на работните процеси на TypeSafe

TypeSafe разработи оценки на работни процеси за 4 задачи: инциденти със сигурността, наблюдение на следи от агенти, обработка на фактури и обслужване на клиенти. Референтните етикети са получени чрез осредняване на GPT-6 Astra и Claude Fable 5.1 при високо ниво на мислене.

  • Jev: 67.8% средна точност, $0.0004 на случай, 0.4 секунди.
  • Claude Sonnet 5 (същият работен процес): 67.8%, $0.1174 на случай, 78.1 секунди.
  • Най-добрият сравнителен модел (OpenAI „sol“): 74.1%, $0.0836 на случай, 23.3 секунди.

Jev постигна същата точност като Sonnet 5 при част от разходите и закъснението. Все пак той изостава с 6.3 пункта от най-добрата конфигурация на водещ модел. По задачи Jev постигна 76.0% при обслужването на клиенти, но само 61.8% при обработката на фактури.

Случаи на употреба: къде се вписват моделите за решения

Основното правило е просто. Ако кодът ви се нуждае от ограничен отговор, въз основа на който ще разклони изпълнението, моделът за решения е подходящ кандидат. Ако човек трябва да прочете резултата, използвайте LLM.

Контролен поток на агенти

  • Избор на следващ инструмент или подагент: Vercel посочва това като основна употреба.
  • Продължаване, повторен опит, питане на потребителя или спиране: Един въпрос от тип Choice заменя ненадеждната стъпка за анализ на JSON.
  • Маршрутизиране на модели: Изпращайте лесните заявки към евтин модел, а трудните — към водещ модел. Fastino посочва маршрутизиране по дестинация, сложност или ниво на ескалация.

Класификация и триаж

  • Маршрутизиране на заявки за поддръжка, триаж на имейли и откриване на намерения: Това представлява голяма част от бенчмарка на Fastino със 17 набора от данни.
  • Откриване на спам, предложения за етикети и приоритизиране: Саймън Уилисън ги определя като естествени приложения за класификация.
  • Триаж на предупреждения за сигурността: Най-простият публикуван работен процес на TypeSafe решава дали да затвори предупреждение, да го предаде на анализатор или да го изолира.

Проверка и безопасност

  • Предпазни механизми и откриване на jailbreak атаки: TypeSafe предлага Jev за оценяване на подсказки, следи от разсъждения и изходни резултати.
  • Съвместни проверки за безопасност: GLiNER2.5-Decide може да декодира едновременно „безопасност“ и „тип вреда“, така че отговорите никога да не си противоречат.
  • Проверени каскади: Ръководството за Jev на OpenRouter описва създаване на чернова с евтин модел, проверка с Jev и ескалация само при неуспех.

Оценяване и наблюдение

  • Замяна на LLM-като-съдия: Arize и Langfuse вече изпълняват оценители на Jev върху следи.
  • CI/CD прагове: Buddy позволява на конвейерите да оценяват, класифицират или блокират изпълнения чрез действие на Jev.

Търсене и обработка на данни

  • Повторно класиране: Оценете 100 BM25 кандидати за релевантност в едно паралелно извикване.
  • Map-reduce върху големи набори от данни: TypeSafe предлага превръщане на масови данни в характеристики на ниска цена.
  • Окастряне на контекста: Fastino посочва избора кой контекст да бъде запазен преди извикване на LLM.

Приложения в реално време

  • Игри и симулации: TypeSafe демонстрира Jev, който играе Doom и Wikiracing.
  • Потребителски интерфейси, чувствителни към закъснението: Решенията за под секунда правят изкуствения интелект използваем в интерактивни процеси.

Кога да не използвате модел за решения

  • Нуждаете се от генериран текст, резюмета или обяснения.
  • Задачата изисква точна аритметика, броене или изчисления с дати. Ръководството на TypeSafe за неравномерност на Jev 1.13 посочва и 3-те случая.
  • Решението засяга препитанието на хората, например при наемане на служители. Уилисън предупреждава, че скритите предубеждения са трудни за проверка.

Практически примери: къде моделите за решения вече работят

1. Приемане на AI Gateway на Vercel

Vercel съобщава, че Jev е станал най-бързо приетият модел в историята на AI Gateway. В рамките на 24 часа почти 13% от платените екипи са го използвали. Това е 2 пъти делът на семейството GPT-5.6 и повече от 6 пъти делът на Fable 5.1.

2. Повторно класиране при търсене

Саймън Уилисън извлякъл 100 кандидати с BM25, след което накарал Jev да оцени всеки от тях за релевантност. Този подход заменя скъпия LLM за повторно класиране с евтини, паралелни въпроси от тип Score.

3. Конвейери за оценяване на LLM

Arize и Langfuse и двете пуснаха оценители Jev-като-съдия. Langfuse обозначава функцията като „оценители на модели за решения“, така че по-късно да могат да бъдат добавени и други модели. Поддръжката на Jev все още е отбелязана като експериментална.

4. Оркестрация на 6G периферийни мрежи

Нова статия в arXiv използва Jev за интерпретиране на договори за услуги в периферията на мрежата. При еднаква коректност Jev намалил медианното закъснение на решенията с 22.4% спрямо DeepSeek и с 61.9% спрямо Gemini.

5. Игрови агенти в реално време

Демонстрацията на Doom от TypeSafe изпълнявала Jev с 10 заявки в секунда. Екипът оценил разходите на приблизително $7 на час.

Конкурентна среда: 7 модела за решения в сравнение

Таблицата по-долу обхваща Jev, най-близкия му комерсиален конкурент и водещите модели с отворени тегла. Всички спецификации са взети от собствената страница за представяне или картата на модела на всеки проект.

МоделРазработчикЛиценз / достъпРазмер и архитектураТипове въпросиОтчетено закъснениеРаботи локално
Jev 1.13TypeSafe AIЗатворен; хостван API на цена $0.042/M входни токени, изходът е безплатенНе е разкрит; нова архитектура, паралелен семплер, RLCDChoice, Score, Noul (до 255 опции)70 до 500 msНе
GLiDEFastino LabsЗатворен; API на Fastino, контекст от 40KНе е разкрит; адаптивно мислене при несигурни случаиИзбрано действие, увереност и вероятности на опциитеНе е разкритоНе
GLiNER2.5-DecideFastino LabsОтворени тегла по Apache 2.0; предлага се и в API на Fastino340M енкодер DeBERTa-v3-largeТипизирани решения със съвместни ограничения, плюс обхвати и релации38.3 ms p50 (V100), 167.3 ms (48-vCPU CPU)Да, CPU или GPU
LayaConvai InnovationsОтворени тегла по Apache 2.0421M ModernBERT-large (английски); 322M mmBERT-base (многоезичен)Choice, Score, Noul; над 100 езика~33 ms на въпрос на GPUДа
JevK5Независим разработчикОтворени тегла по Apache 2.04B, Qwen3.5-4B със слята LoRAВероятност за всяка опция в един проходНе е посоченоДа, GPU
OpenJevTheo LeeMITЗамразен Qwen3.5-4B, чете логитите на опциитеТипизирани опции в един проход5.21 пъти по-бърз от авторегресивен JSONДа, потребителски GPU
kev-0.5bJared PalmerApache 2.0 (базовият модел е под лиценза на Qwen)LoRA плюс глава за извеждане върху Qwen2.5-0.5B; API, съвместим с JevNoul, Choice (2 до 255), Score~160 ms за 6 въпроса (Apple M5)Да, лаптоп
Общ LLM + структуриран изходМногоПредимно затворени; входни плюс изходни токениАвторегресивен декодерВсичко, като генериран текстОбикновено секундиЗависи

Директни сравнителни числа (собствен бенчмарк на всеки доставчик)

Тези резултати идват от различни тестови набори. Не сравнявайте числата между редовете.

Бенчмарк (отчетен от)Резултати
Оценки на работни процеси (TypeSafe)Jev 67.8%, Sonnet 5 67.8%, най-добър LLM 74.1%
Decision Index 0.2.1 (Fastino)GLiDE 64.81, Jev 57.91
Точност CLadder (Fastino)GLiDE 88.7%, Jev 72.6%
Точност CRUXEval (Fastino)GLiDE 92.6%, Jev 73.0%
Fast Decisions, 17 набора от данни (Fastino)GLiNER2.5-Decide 60.1%, JevK5 57.5%, SemIf 56.4%, GLiFormer 49.0%, Laya 46.6%
Подмножество от 102 реда на оценката на TypeSafe (OpenJev)Jev 0.883, OpenJev 0.845 балансирана точност

Тук са важни две уговорки. Fastino е избрала както тестовете, така и конкурентите за твърденията си относно GLiDE и GLiNER2.5-Decide. Сравнението Fast Decisions също използва JevK5, отворена репродукция, а не Jev на TypeSafe.

Как да изберете

  • Изберете Jev за управляван API с най-широка екосистемна поддръжка към момента.
  • Изберете GLiDE, за да тествате по-трудни решения, изискващи интензивно разсъждение, и проверете твърденията на Fastino със собствените си данни.
  • Изберете GLiNER2.5-Decide за внедряване в изолирана мрежа, дообучаване или отговори, които трябва да спазват правила между въпросите.
  • Изберете Laya за многоезични решения или много ниско закъснение на въпрос.
  • Изберете kev, OpenJev или JevK5, за да експериментирате локално или да избегнете обвързването с доставчик.

Защо моделите за решения са последната тенденция в изкуствения интелект

Идеята не е нова. Класификаторите и моделите за повторно класиране вземат решения от години. Decision Transformer (2021) представи обучението с подсилване като моделиране на последователности. Gato на DeepMind (2022) показа един общ модел, който изпълнява действия в множество задачи. Проучване от 2023 г. дори нарече „големите модели за решения“ следващата стъпка.

Това, което се промени през 2026 г., е начинът на представяне. 4 сили доведоха до промяната:

  • Агентите се нуждаят от евтини преценки: Маршрутизирането, изборът на инструменти и предпазните механизми се случват хиляди пъти във всеки работен процес. Плащането на водещи цени за всяка от тях не се мащабира.
  • Калибрирането позволява автоматизация: Оценката на увереността позволява на кода да действа самостоятелно, когато е сигурен, и да ескалира, когато не е.
  • Екосистемата се разви бързо: В рамките на седмици Jev се появи във Vercel, OpenRouter, Arize, Langfuse и Buddy.
  • Конкуренцията се появи незабавно: Fastino пусна GLiNER2.5-Decide на 24 септември и GLiDE на 30 септември. Отворени репродукции като kev, OpenJev и JevK5 се появиха паралелно.

Основни изводи

  • Моделите за решения с изкуствен интелект връщат типизирани отговори с вероятности, а не генериран текст.
  • Jev струва $0.042 на милион входни токени, а изходът е безплатен.
  • При оценките на TypeSafe Jev постигна същата точност като Sonnet 5 при 0.4 секунди на случай.
  • GLiDE и GLiNER2.5-Decide на Fastino са водещи модели в бързо разрастващо се поле от конкуренти.
  • Използвайте моделите за решения за маршрутизиране и оценяване, а LLM — за разсъждение и писане.

Често задавани въпроси

  • Моделът за решения същото ли е като LLM? Отговорът е „Не“. Моделът за решения чете текст като LLM, но извежда вероятности за предварително зададени отговори. Той не може да пише, обобщава или обяснява.
  • Кога трябва да използвам модел за решения вместо LLM? Използвайте такъв за преценки с голям обем и ограничен обхват: класификация, маршрутизиране, триаж, предпазни механизми, повторно класиране и оценки. Запазете LLM за отворено разсъждение и генериране.
  • Мога ли да изпълнявам модел за решения на собствен хардуер? Jev и GLiDE са достъпни само чрез API. GLiNER2.5-Decide, Laya, JevK5, OpenJev и kev разполагат с отворени тегла, които можете да изпълнявате локално.
  • Кой е основният конкурент на Jev? Fastino Labs е най-прекият комерсиален конкурент. Компанията предлага GLiDE като хостван API, а GLiNER2.5-Decide — като модел с отворени тегла.

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини