Объяснение моделей Decision AI: TypeSafe Jev против Fastino GLiDE, GLiNER2.5-Decide и конкурентов с открытым исходным кодом
Что такое модели Decision AI?
Модели Decision AI — это новый класс моделей, которые возвращают решение, а не абзац текста. Вы отправляете текст с типизированными вопросами. Модель возвращает варианты, оценки или вероятности «да/нет», на основе которых ваш код может напрямую принимать решения.
Категория вышла на массовый рынок, когда TypeSafe AI представила Jev после двух лет работы в закрытом режиме. TypeSafe называет её «моделью System One» — в честь быстрого, интуитивного мышления System 1 Даниэля Канемана.
В течение трёх недель Fastino Labs выпустила две конкурирующие модели, а разработчики открытого ПО опубликовали несколько воспроизведений в стиле Jev. В этой статье рассказывается, как работает эта категория, где она применима и как сравниваются доступные варианты.
Как работает Jev
Jev принимает «состояние» (строку, массив или набор пар «имя—значение») и один или несколько вопросов. Согласно документации TypeSafe, модель поддерживает три примитива:
- Choice: выбор одного варианта из списка с вероятностями и уверенностью. TypeSafe заявляет, что Jev поддерживает до 255 вариантов.
- Score: оценка состояния по шкале упорядоченных уровней с вероятностями и уверенностью.
- Noul: вероятность от 0 до 1 того, что утверждение истинно. Название — сокращение от Bernoulli.
Каждый вопрос оценивается параллельно и независимо относительно одного и того же состояния. Добавление вопросов почти не увеличивает время ответа. Поскольку Jev никогда не генерирует строки, TypeSafe утверждает, что модель не может вернуть ошибку типа.
В основе лежат новая архитектура, параллельный сэмплер и метод обучения под названием Reinforcement Learning for Calibrated Decisions (RLCD). RLHF оптимизирует соответствие человеческим предпочтениям. RLCD оптимизирует калиброванные вероятности, при которых более высокая уверенность должна означать более высокую точность.
Главное, за чем стоит следить, — цена. Jev стоит $0.042 за миллион входных токенов, а вывод предоставляется бесплатно. OpenRouter указывает контекстное окно в 32K токенов. TypeSafe сообщает о сквозном времени ответа от 70 до 500 миллисекунд.
Интерактивное объяснение
Бенчмарки: что показывают рабочие оценки TypeSafe
TypeSafe провела оценку рабочих процессов по четырём задачам: инциденты безопасности, наблюдаемость трассировок агентов, обработка счетов и обслуживание клиентов. Эталонные метки получены усреднением результатов GPT-6 Astra и Claude Fable 5.1 в режиме интенсивного рассуждения.
- Jev: средняя точность 67,8%, $0.0004 за случай, 0,4 секунды.
- Claude Sonnet 5 (тот же рабочий процесс): 67,8%, $0.1174 за случай, 78,1 секунды.
- Лучшая сравнительная модель (OpenAI «sol»): 74,1%, $0.0836 за случай, 23,3 секунды.
Jev достигла такой же точности, как Sonnet 5, при значительно меньших стоимости и задержке. При этом модель отстаёт на 6,3 процентного пункта от лучшей конфигурации передовой модели. В разрезе задач Jev набрала 76,0% в обслуживании клиентов, но лишь 61,8% в обработке счетов.
Сценарии использования: где применимы модели решений
Общее правило простое. Если вашему коду нужен ограниченный ответ, на основании которого он будет принимать решение, модель решений подходит для такой задачи. Если вывод должен прочитать человек, используйте LLM.
Управление потоком выполнения агента
- Выбор следующего инструмента или субагента: Vercel называет это одним из основных применений.
- Продолжить, повторить попытку, спросить пользователя или остановиться: один вопрос Choice заменяет хрупкий этап разбора JSON.
- Маршрутизация моделей: отправляйте простые запросы дешёвой модели, а сложные — передовой модели. Fastino перечисляет маршрутизацию по назначению, сложности или уровню эскалации.
Классификация и сортировка
- Маршрутизация обращений в поддержку, сортировка электронной почты и определение намерений: эти задачи составляют значительную часть бенчмарка Fastino из 17 наборов данных.
- Обнаружение спама, предложения меток и приоритизация: Саймон Уиллисон считает их естественными задачами для классификации.
- Сортировка предупреждений безопасности: в простейшем опубликованном рабочем процессе TypeSafe определяется, следует ли закрыть предупреждение, передать его аналитику или локализовать угрозу.
Проверка и безопасность
- Ограничители и обнаружение джейлбрейков: TypeSafe предлагает Jev для оценки промптов, трассировок рассуждений и результатов.
- Совместные проверки безопасности: GLiNER2.5-Decide может одновременно декодировать «безопасность» и «тип вреда», чтобы ответы никогда не противоречили друг другу.
- Проверенные каскады: руководство OpenRouter по Jev описывает создание черновика дешёвой моделью, проверку с помощью Jev и эскалацию только в случае сбоя.
Оценка и наблюдаемость
- Замена LLM в роли судьи: Arize и Langfuse теперь запускают оценщики Jev на трассировках.
- Шлюзы CI/CD: Buddy позволяет конвейерам оценивать, классифицировать или блокировать запуски с помощью действия Jev.
Поиск и обработка данных
- Переранжирование: оценивайте 100 кандидатов BM25 на релевантность за один параллельный вызов.
- Map-reduce для больших наборов данных: TypeSafe предлагает с небольшими затратами превращать большие массивы данных в признаки.
- Сокращение контекста: Fastino перечисляет выбор контекста, который нужно сохранить перед вызовом LLM.
Приложения реального времени
- Игры и симуляции: TypeSafe демонстрировала, как Jev играет в Doom и Wikiracing.
- Интерфейсы, критичные к задержке: решения менее чем за секунду делают ИИ пригодным для использования в интерактивных сценариях.
Когда не следует использовать модель решений
- Вам нужны сгенерированный текст, резюме или объяснения.
- Задача требует точной арифметики, подсчёта или вычислений с датами. Руководство TypeSafe по «зазубренности» Jev 1.13 указывает на все три ограничения.
- Решение влияет на средства к существованию людей, например при найме сотрудников. Уиллисон предупреждает, что скрытую предвзятость трудно выявить.
Практические примеры: где модели решений уже работают
1. Внедрение Vercel AI Gateway
Vercel сообщает, что Jev стала самой быстро внедряемой моделью в истории AI Gateway. В течение 24 часов её использовали почти 13% платных команд. Это в два раза больше доли семейства GPT-5.6 и более чем в шесть раз больше доли Fable 5.1.
2. Переранжирование поиска
Саймон Уиллисон получил 100 кандидатов с помощью BM25, а затем поручил Jev оценить релевантность каждого. Этот подход заменяет дорогую LLM для переранжирования дешёвыми параллельными вопросами Score.
3. Конвейеры оценки LLM
Arize и Langfuse выпустили оценщики Jev-as-a-judge. Langfuse называет эту функцию «оценщиками моделей решений», чтобы позже можно было добавлять другие модели. Поддержка Jev всё ещё помечена как экспериментальная.
4. Оркестрация периферийной сети 6G
В новой статье на arXiv Jev использовалась для интерпретации соглашений об обслуживании на периферии сети. При одинаковой корректности Jev сократила медианную задержку принятия решений на 22,4% по сравнению с DeepSeek и на 61,9% по сравнению с Gemini.
5. Игровые агенты реального времени
В демонстрации Doom от TypeSafe Jev выполняла 10 запросов в секунду. Команда оценила стоимость примерно в $7 в час.
Обзор конкурентов: сравнение 7 моделей решений
В таблице ниже представлены Jev, её ближайший коммерческий конкурент и ведущие модели с открытыми весами. Все характеристики взяты со страницы релиза или из карточки модели соответствующего проекта.
| Модель | Разработчик | Лицензия / доступ | Размер и архитектура | Типы вопросов | Заявленная задержка | Работает локально |
|---|---|---|---|---|---|---|
| Jev 1.13 | TypeSafe AI | Закрытая; размещённый API за $0.042/млн входных токенов, вывод бесплатный | Не раскрыто; новая архитектура, параллельный сэмплер, RLCD | Choice, Score, Noul (до 255 вариантов) | 70–500 мс | Нет |
| GLiDE | Fastino Labs | Закрытая; API Fastino, контекст 40K | Не раскрыто; адаптивное рассуждение в неопределённых случаях | Выбранное действие, уверенность и вероятности вариантов | Не раскрыто | Нет |
| GLiNER2.5-Decide | Fastino Labs | Открытые веса Apache 2.0; также доступна через API Fastino | Энкодер DeBERTa-v3-large на 340 млн параметров | Типизированные решения с совместными ограничениями, а также спаны и отношения | 38,3 мс p50 (V100), 167,3 мс (CPU с 48 vCPU) | Да, на CPU или GPU |
| Laya | Convai Innovations | Открытые веса Apache 2.0 | 421 млн параметров ModernBERT-large (английский); 322 млн параметров mmBERT-base (мультиязычная) | Choice, Score, Noul; более 100 языков | ~33 мс на вопрос на GPU | Да |
| JevK5 | Независимый разработчик | Открытые веса Apache 2.0 | 4B, Qwen3.5-4B со слитым LoRA | Вероятность каждого варианта за один проход | Не указана | Да, на GPU |
| OpenJev | Theo Lee | MIT | Замороженная Qwen3.5-4B, считывает логиты вариантов | Типизированные варианты за один проход | В 5,21 раза быстрее авторегрессионного JSON | Да, на потребительском GPU |
| kev-0.5b | Jared Palmer | Apache 2.0 (базовая модель распространяется по лицензии Qwen) | LoRA и выходная голова на Qwen2.5-0.5B; API, совместимый с Jev | Noul, Choice (от 2 до 255), Score | ~160 мс для 6 вопросов (Apple M5) | Да, на ноутбуке |
| Общая LLM + структурированный вывод | Многие | В основном закрытые; входные и выходные токены | Авторегрессионный декодер | Любые, в виде сгенерированного текста | Обычно секунды | Зависит от модели |
Сравнение один на один (собственные бенчмарки каждого поставщика)
Эти показатели получены в разных наборах тестов. Не сравнивайте числа в разных строках.
| Бенчмарк (по данным) | Результаты |
|---|---|
| Оценка рабочих процессов (TypeSafe) | Jev 67,8%, Sonnet 5 67,8%, лучшая LLM 74,1% |
| Decision Index 0.2.1 (Fastino) | GLiDE 64,81, Jev 57,91 |
| Точность CLadder (Fastino) | GLiDE 88,7%, Jev 72,6% |
| Точность CRUXEval (Fastino) | GLiDE 92,6%, Jev 73,0% |
| Fast Decisions, 17 наборов данных (Fastino) | GLiNER2.5-Decide 60,1%, JevK5 57,5%, SemIf 56,4%, GLiFormer 49,0%, Laya 46,6% |
| Подмножество оценки TypeSafe из 102 строк (OpenJev) | Jev 0,883, OpenJev 0,845 сбалансированной точности |
Здесь важны два уточнения. Fastino самостоятельно выбрала и тесты, и соперников для заявлений о GLiDE и GLiNER2.5-Decide. В сравнении Fast Decisions также используется JevK5 — открытое воспроизведение, а не Jev от TypeSafe.
Как выбрать
- Выбирайте Jev для управляемого API с наиболее широкой экосистемой на сегодняшний день.
- Выбирайте GLiDE, чтобы тестировать более сложные решения, требующие рассуждений, и проверять заявления Fastino на собственных данных.
- Выбирайте GLiNER2.5-Decide для развёртывания в изолированной среде, дообучения или ответов, которые должны соблюдать правила между вопросами.
- Выбирайте Laya для мультиязычных решений или очень низкой задержки на вопрос.
- Выбирайте kev, OpenJev или JevK5, чтобы экспериментировать локально или избежать привязки к поставщику.
Почему модели решений — последний тренд в ИИ
Эта идея не нова. Классификаторы и модели переранжирования принимают решения уже много лет. Decision Transformer (2021) представил обучение с подкреплением как моделирование последовательностей. Gato от DeepMind (2022) показала, как одна универсальная модель выполняет множество задач. В обзоре 2023 года «большие модели решений» даже были названы следующим этапом развития.
В 2026 году изменился способ подачи этой идеи. Сдвиг обусловили четыре фактора:
- Агентам нужны дешёвые оценки: маршрутизация, выбор инструментов и ограничители выполняются тысячи раз за рабочий процесс. Оплачивать передовую модель для каждого такого действия невозможно в масштабах.
- Калибровка позволяет автоматизировать процессы: оценка уверенности позволяет коду действовать самостоятельно при высокой уверенности и передавать задачу на эскалацию при низкой.
- Экосистема развивалась быстро: за несколько недель Jev появилась в Vercel, OpenRouter, Arize, Langfuse и Buddy.
- Конкуренция возникла сразу: Fastino выпустила GLiNER2.5-Decide 24 сентября, а GLiDE — 30 сентября. Параллельно появились открытые воспроизведения, такие как kev, OpenJev и JevK5.
Основные выводы
- Модели Decision AI возвращают типизированные ответы с вероятностями, а не сгенерированный текст.
- Jev стоит $0.042 за миллион входных токенов, а вывод предоставляется бесплатно.
- В оценках TypeSafe Jev достигла точности Sonnet 5 при времени 0,4 секунды на случай.
- GLiDE и GLiNER2.5-Decide от Fastino возглавляют быстро растущее поле конкурирующих моделей.
- Используйте модели решений для маршрутизации и оценивания, а LLM — для рассуждений и написания текста.
Часто задаваемые вопросы
- Является ли модель решений тем же самым, что и LLM? Нет. Модель решений читает текст, как LLM, но выдаёт вероятности для заранее определённых ответов. Она не может писать, обобщать или объяснять.
- Когда следует использовать модель решений вместо LLM? Используйте её для массовых ограниченных оценок: классификации, маршрутизации, сортировки, ограничителей, переранжирования и оценки. LLM оставьте для открытых рассуждений и генерации.
- Можно ли запустить модель решений на собственном оборудовании? Jev и GLiDE доступны только через API. GLiNER2.5-Decide, Laya, JevK5, OpenJev и kev имеют открытые веса, которые можно запускать локально.
- Кто является главным конкурентом Jev? Fastino Labs — её самый прямой коммерческий конкурент. Компания выпускает GLiDE как размещённый API, а GLiNER2.5-Decide — как модель с открытыми весами.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.