Обяснение на Decision AI моделите: TypeSafe Jev срещу Fastino GLiDE, GLiNER2.5-Decide и конкурентите с отворен код
Какво представляват моделите за решения с изкуствен интелект?
Моделите за решения с изкуствен интелект са нов клас модели, които връщат решение, а не абзац. Изпращате текст с типизирани въпроси. Моделът връща избори, оценки или вероятности „да/не“, на които кодът ви може директно да разклони изпълнението.
Категорията навлезе в мейнстрийма, когато TypeSafe AI представи Jev след 2 години в режим на секретност. TypeSafe го нарича „модел System One“, по аналогия с бързото, интуитивно мислене System 1 на Даниел Канеман.
В рамките на 3 седмици Fastino Labs пусна 2 конкурентни модела, а разработчици на софтуер с отворен код публикуваха няколко репродукции в стила на Jev. Тази статия разглежда как работи категорията, къде намира приложение и как се сравняват различните възможности.
Как работи Jev
Jev приема „състояние“ (низ, масив или набор от двойки име-стойност) и един или повече въпроси. Според документацията на TypeSafe, той поддържа 3 примитива:
- Choice: избор на една опция от списък, с вероятности и увереност. TypeSafe посочва, че Jev поддържа до 255 опции.
- Score: оценяване на състоянието по рубрика с подредени нива, с вероятности и увереност.
- Noul: вероятност от 0 до 1, че дадено твърдение е вярно. Името е съкращение от Bernoulli.
Всеки въпрос се оценява паралелно и независимо спрямо едно и също състояние. Добавянето на въпроси почти не променя времето за отговор. Тъй като Jev никога не генерира низове, TypeSafe твърди, че той не може да върне грешка в типа.
Под капака TypeSafe описва нова архитектура, паралелен семплер и метод за обучение, наречен Reinforcement Learning for Calibrated Decisions (RLCD). RLHF оптимизира за човешко предпочитание. RLCD оптимизира за калибрирани вероятности, при които по-високата увереност трябва да означава по-висока точност.
Ценообразуването е основното, което трябва да се следи. Jev струва $0.042 на милион входни токени, а изходът е безплатен. OpenRouter посочва контекстен прозорец от 32K. TypeSafe отчита отговори от край до край за 70 до 500 милисекунди.
Интерактивно обяснение
Бенчмаркове: какво показват оценките на работните процеси на TypeSafe
TypeSafe разработи оценки на работни процеси за 4 задачи: инциденти със сигурността, наблюдение на следи от агенти, обработка на фактури и обслужване на клиенти. Референтните етикети са получени чрез осредняване на GPT-6 Astra и Claude Fable 5.1 при високо ниво на мислене.
- Jev: 67.8% средна точност, $0.0004 на случай, 0.4 секунди.
- Claude Sonnet 5 (същият работен процес): 67.8%, $0.1174 на случай, 78.1 секунди.
- Най-добрият сравнителен модел (OpenAI „sol“): 74.1%, $0.0836 на случай, 23.3 секунди.
Jev постигна същата точност като Sonnet 5 при част от разходите и закъснението. Все пак той изостава с 6.3 пункта от най-добрата конфигурация на водещ модел. По задачи Jev постигна 76.0% при обслужването на клиенти, но само 61.8% при обработката на фактури.
Случаи на употреба: къде се вписват моделите за решения
Основното правило е просто. Ако кодът ви се нуждае от ограничен отговор, въз основа на който ще разклони изпълнението, моделът за решения е подходящ кандидат. Ако човек трябва да прочете резултата, използвайте LLM.
Контролен поток на агенти
- Избор на следващ инструмент или подагент: Vercel посочва това като основна употреба.
- Продължаване, повторен опит, питане на потребителя или спиране: Един въпрос от тип Choice заменя ненадеждната стъпка за анализ на JSON.
- Маршрутизиране на модели: Изпращайте лесните заявки към евтин модел, а трудните — към водещ модел. Fastino посочва маршрутизиране по дестинация, сложност или ниво на ескалация.
Класификация и триаж
- Маршрутизиране на заявки за поддръжка, триаж на имейли и откриване на намерения: Това представлява голяма част от бенчмарка на Fastino със 17 набора от данни.
- Откриване на спам, предложения за етикети и приоритизиране: Саймън Уилисън ги определя като естествени приложения за класификация.
- Триаж на предупреждения за сигурността: Най-простият публикуван работен процес на TypeSafe решава дали да затвори предупреждение, да го предаде на анализатор или да го изолира.
Проверка и безопасност
- Предпазни механизми и откриване на jailbreak атаки: TypeSafe предлага Jev за оценяване на подсказки, следи от разсъждения и изходни резултати.
- Съвместни проверки за безопасност: GLiNER2.5-Decide може да декодира едновременно „безопасност“ и „тип вреда“, така че отговорите никога да не си противоречат.
- Проверени каскади: Ръководството за Jev на OpenRouter описва създаване на чернова с евтин модел, проверка с Jev и ескалация само при неуспех.
Оценяване и наблюдение
- Замяна на LLM-като-съдия: Arize и Langfuse вече изпълняват оценители на Jev върху следи.
- CI/CD прагове: Buddy позволява на конвейерите да оценяват, класифицират или блокират изпълнения чрез действие на Jev.
Търсене и обработка на данни
- Повторно класиране: Оценете 100 BM25 кандидати за релевантност в едно паралелно извикване.
- Map-reduce върху големи набори от данни: TypeSafe предлага превръщане на масови данни в характеристики на ниска цена.
- Окастряне на контекста: Fastino посочва избора кой контекст да бъде запазен преди извикване на LLM.
Приложения в реално време
- Игри и симулации: TypeSafe демонстрира Jev, който играе Doom и Wikiracing.
- Потребителски интерфейси, чувствителни към закъснението: Решенията за под секунда правят изкуствения интелект използваем в интерактивни процеси.
Кога да не използвате модел за решения
- Нуждаете се от генериран текст, резюмета или обяснения.
- Задачата изисква точна аритметика, броене или изчисления с дати. Ръководството на TypeSafe за неравномерност на Jev 1.13 посочва и 3-те случая.
- Решението засяга препитанието на хората, например при наемане на служители. Уилисън предупреждава, че скритите предубеждения са трудни за проверка.
Практически примери: къде моделите за решения вече работят
1. Приемане на AI Gateway на Vercel
Vercel съобщава, че Jev е станал най-бързо приетият модел в историята на AI Gateway. В рамките на 24 часа почти 13% от платените екипи са го използвали. Това е 2 пъти делът на семейството GPT-5.6 и повече от 6 пъти делът на Fable 5.1.
2. Повторно класиране при търсене
Саймън Уилисън извлякъл 100 кандидати с BM25, след което накарал Jev да оцени всеки от тях за релевантност. Този подход заменя скъпия LLM за повторно класиране с евтини, паралелни въпроси от тип Score.
3. Конвейери за оценяване на LLM
Arize и Langfuse и двете пуснаха оценители Jev-като-съдия. Langfuse обозначава функцията като „оценители на модели за решения“, така че по-късно да могат да бъдат добавени и други модели. Поддръжката на Jev все още е отбелязана като експериментална.
4. Оркестрация на 6G периферийни мрежи
Нова статия в arXiv използва Jev за интерпретиране на договори за услуги в периферията на мрежата. При еднаква коректност Jev намалил медианното закъснение на решенията с 22.4% спрямо DeepSeek и с 61.9% спрямо Gemini.
5. Игрови агенти в реално време
Демонстрацията на Doom от TypeSafe изпълнявала Jev с 10 заявки в секунда. Екипът оценил разходите на приблизително $7 на час.
Конкурентна среда: 7 модела за решения в сравнение
Таблицата по-долу обхваща Jev, най-близкия му комерсиален конкурент и водещите модели с отворени тегла. Всички спецификации са взети от собствената страница за представяне или картата на модела на всеки проект.
| Модел | Разработчик | Лиценз / достъп | Размер и архитектура | Типове въпроси | Отчетено закъснение | Работи локално |
|---|---|---|---|---|---|---|
| Jev 1.13 | TypeSafe AI | Затворен; хостван API на цена $0.042/M входни токени, изходът е безплатен | Не е разкрит; нова архитектура, паралелен семплер, RLCD | Choice, Score, Noul (до 255 опции) | 70 до 500 ms | Не |
| GLiDE | Fastino Labs | Затворен; API на Fastino, контекст от 40K | Не е разкрит; адаптивно мислене при несигурни случаи | Избрано действие, увереност и вероятности на опциите | Не е разкрито | Не |
| GLiNER2.5-Decide | Fastino Labs | Отворени тегла по Apache 2.0; предлага се и в API на Fastino | 340M енкодер DeBERTa-v3-large | Типизирани решения със съвместни ограничения, плюс обхвати и релации | 38.3 ms p50 (V100), 167.3 ms (48-vCPU CPU) | Да, CPU или GPU |
| Laya | Convai Innovations | Отворени тегла по Apache 2.0 | 421M ModernBERT-large (английски); 322M mmBERT-base (многоезичен) | Choice, Score, Noul; над 100 езика | ~33 ms на въпрос на GPU | Да |
| JevK5 | Независим разработчик | Отворени тегла по Apache 2.0 | 4B, Qwen3.5-4B със слята LoRA | Вероятност за всяка опция в един проход | Не е посочено | Да, GPU |
| OpenJev | Theo Lee | MIT | Замразен Qwen3.5-4B, чете логитите на опциите | Типизирани опции в един проход | 5.21 пъти по-бърз от авторегресивен JSON | Да, потребителски GPU |
| kev-0.5b | Jared Palmer | Apache 2.0 (базовият модел е под лиценза на Qwen) | LoRA плюс глава за извеждане върху Qwen2.5-0.5B; API, съвместим с Jev | Noul, Choice (2 до 255), Score | ~160 ms за 6 въпроса (Apple M5) | Да, лаптоп |
| Общ LLM + структуриран изход | Много | Предимно затворени; входни плюс изходни токени | Авторегресивен декодер | Всичко, като генериран текст | Обикновено секунди | Зависи |
Директни сравнителни числа (собствен бенчмарк на всеки доставчик)
Тези резултати идват от различни тестови набори. Не сравнявайте числата между редовете.
| Бенчмарк (отчетен от) | Резултати |
|---|---|
| Оценки на работни процеси (TypeSafe) | Jev 67.8%, Sonnet 5 67.8%, най-добър LLM 74.1% |
| Decision Index 0.2.1 (Fastino) | GLiDE 64.81, Jev 57.91 |
| Точност CLadder (Fastino) | GLiDE 88.7%, Jev 72.6% |
| Точност CRUXEval (Fastino) | GLiDE 92.6%, Jev 73.0% |
| Fast Decisions, 17 набора от данни (Fastino) | GLiNER2.5-Decide 60.1%, JevK5 57.5%, SemIf 56.4%, GLiFormer 49.0%, Laya 46.6% |
| Подмножество от 102 реда на оценката на TypeSafe (OpenJev) | Jev 0.883, OpenJev 0.845 балансирана точност |
Тук са важни две уговорки. Fastino е избрала както тестовете, така и конкурентите за твърденията си относно GLiDE и GLiNER2.5-Decide. Сравнението Fast Decisions също използва JevK5, отворена репродукция, а не Jev на TypeSafe.
Как да изберете
- Изберете Jev за управляван API с най-широка екосистемна поддръжка към момента.
- Изберете GLiDE, за да тествате по-трудни решения, изискващи интензивно разсъждение, и проверете твърденията на Fastino със собствените си данни.
- Изберете GLiNER2.5-Decide за внедряване в изолирана мрежа, дообучаване или отговори, които трябва да спазват правила между въпросите.
- Изберете Laya за многоезични решения или много ниско закъснение на въпрос.
- Изберете kev, OpenJev или JevK5, за да експериментирате локално или да избегнете обвързването с доставчик.
Защо моделите за решения са последната тенденция в изкуствения интелект
Идеята не е нова. Класификаторите и моделите за повторно класиране вземат решения от години. Decision Transformer (2021) представи обучението с подсилване като моделиране на последователности. Gato на DeepMind (2022) показа един общ модел, който изпълнява действия в множество задачи. Проучване от 2023 г. дори нарече „големите модели за решения“ следващата стъпка.
Това, което се промени през 2026 г., е начинът на представяне. 4 сили доведоха до промяната:
- Агентите се нуждаят от евтини преценки: Маршрутизирането, изборът на инструменти и предпазните механизми се случват хиляди пъти във всеки работен процес. Плащането на водещи цени за всяка от тях не се мащабира.
- Калибрирането позволява автоматизация: Оценката на увереността позволява на кода да действа самостоятелно, когато е сигурен, и да ескалира, когато не е.
- Екосистемата се разви бързо: В рамките на седмици Jev се появи във Vercel, OpenRouter, Arize, Langfuse и Buddy.
- Конкуренцията се появи незабавно: Fastino пусна GLiNER2.5-Decide на 24 септември и GLiDE на 30 септември. Отворени репродукции като kev, OpenJev и JevK5 се появиха паралелно.
Основни изводи
- Моделите за решения с изкуствен интелект връщат типизирани отговори с вероятности, а не генериран текст.
- Jev струва $0.042 на милион входни токени, а изходът е безплатен.
- При оценките на TypeSafe Jev постигна същата точност като Sonnet 5 при 0.4 секунди на случай.
- GLiDE и GLiNER2.5-Decide на Fastino са водещи модели в бързо разрастващо се поле от конкуренти.
- Използвайте моделите за решения за маршрутизиране и оценяване, а LLM — за разсъждение и писане.
Често задавани въпроси
- Моделът за решения същото ли е като LLM? Отговорът е „Не“. Моделът за решения чете текст като LLM, но извежда вероятности за предварително зададени отговори. Той не може да пише, обобщава или обяснява.
- Кога трябва да използвам модел за решения вместо LLM? Използвайте такъв за преценки с голям обем и ограничен обхват: класификация, маршрутизиране, триаж, предпазни механизми, повторно класиране и оценки. Запазете LLM за отворено разсъждение и генериране.
- Мога ли да изпълнявам модел за решения на собствен хардуер? Jev и GLiDE са достъпни само чрез API. GLiNER2.5-Decide, Laya, JevK5, OpenJev и kev разполагат с отворени тегла, които можете да изпълнявате локално.
- Кой е основният конкурент на Jev? Fastino Labs е най-прекият комерсиален конкурент. Компанията предлага GLiDE като хостван API, а GLiNER2.5-Decide — като модел с отворени тегла.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.