20 агентных сценариев использования Jev от TypeSafe AI
MarkTechPost·10 мин чтения
На прошлой неделе TypeSafe AI выпустила Jev, свою первую модель System One. Основатель компании Диого Алмейда ранее работал в OpenAI над исследованиями следования инструкциям, которые легли в основу ChatGPT.
Jev не ведёт диалоги, не пишет код и не составляет резюме. Он принимает неструктурированное состояние и возвращает типизированные решения с откалиброванными вероятностями. Это делает модель естественным инструментом для тысяч небольших решений внутри агентского цикла: какую модель вызвать, безопасна ли команда, какой фрагмент релевантен, действительно ли агент завершил работу.
Как работает Jev
Каждый вызов отправляет state (текст или JSON), а также словарь типизированных вопросов. Документация TypeSafe определяет 3 примитива:
Choice выбирает один вариант из списка и возвращает вероятность для каждого варианта, а также уровень уверенности.
Score оценивает состояние по уровням упорядоченной шкалы и возвращает вероятности и уровень уверенности.
Noul возвращает вероятность (от 0 до 1) того, что утверждение истинно.
Все вопросы оцениваются параллельно относительно одного и того же состояния в рамках одного запроса. TypeSafe обучает Jev с помощью Reinforcement Learning for Calibrated Decisions (RLCD), поэтому более высокая уверенность должна соответствовать более высокой точности. Choice поддерживает до 255 вариантов.
Основные заявленные показатели — в 193,6 раза быстрее и в 444,6 раза дешевле — получены в результате собственных тестов рабочих процессов TypeSafe. В публикации о запуске говорится, что эти цифры находятся на верхней границе показателей, наблюдаемых в реальных сценариях, а в качестве эталона правильного ответа использовались GPT-6 Astra и Fable 5.1.
Сравните LLM, генерирующую токены один за другим, с однопроходным Jev, перемещайте порог уверенности, чтобы увидеть, как код принимает решения, оцените ежемесячную стоимость и просмотрите все 20 вариантов использования.
20 вариантов использования Jev в агентских системах
Маршрутизация и оркестрация
Маршрутизация моделей: оценить сложность запроса, а затем отправить его быстрой или мощной модели. LangChain предлагает это в виде ModelRouterMiddleware; jev-router выполняет это для каждого хода в Claude Code и Codex.
Типизированные вызовы функций: кулинарная книга по вызову функций сопоставляет торговые запросы на естественном языке с именами функций и аргументами из закрытого набора, используя порог уверенности.
Сортировка тикетов и маршрутизация по намерению: один вызов возвращает отдел, раздражение и срочность. Шаблон маршрутизации по намерению отправляет каждый запрос в детерминированную логику, специализированную LLM или человеку.
Безопасность и защитные механизмы
Контроль риска вызова инструмента: pi-warden спрашивает, является ли ожидающая выполнения команда bash, запись или редактирование необратимыми либо не относящимися к задаче. Система различает db:reset после запроса «сбросить базу данных» и db:reset после запроса «добавить колонку». AutoModeMiddleware LangChain возвращает ошибку для рискованных вызовов.
Автоматическое одобрение операций только для чтения: jev-auto-approve — это хук Claude Code, который автоматически одобряет действия только при p ≥ 0,95; в опубликованной калибровке он одобрил 0 из 8 команд, изменяющих состояние.
Защита от утечки секретов: jev-secret-guard отправляет замаскированные строки в Jev и в своей калибровке заблокировал 6 из 6 секретов и 0 из 6 безопасных строк.
Проверка на промпт-инъекции: в кулинарной книге TypeSafe по RAG-фрагментам косинусное сходство поставило внедрённую инъекцию на первое место с результатом 0,584. Jev оценил её в 0,99 и отбросил.
Защитные механизмы для ввода и вывода LLM: кулинарная книга по защитным механизмам использует пороги вероятностей опасности, чтобы пропускать, отправлять на проверку, блокировать или перенаправлять каждое сообщение.
Поиск и заземление
Переранжирование: на 40 юридических запросах CLERC кулинарная книга по переранжированию повысила точность top-1 с 5% до 18%, а top-10 — с 38% до 62%.
Проверка цитат: кулинарная книга по проверке цитат использует один Choice, чтобы определить, поддерживает ли раздел источника утверждение, противоречит ему или ничего о нём не говорит.
Компьютерное управление, браузеры и работа в реальном времени
Браузерные агенты: Jev Ultrafast от Browser Use выбирает операцию и элемент DOM в одном запросе и выполняет поиск Google Flights примерно за 7,1 секунды.
Управление настольным компьютером: typesafe-computer-use распознаёт экран macOS, а Jev классифицирует следующее действие примерно за $0,0002 на шаг.
Мобильные агенты: Mobile Jev принимает решение о каждом касании Android, достигая экрана оплаты Uber примерно за 21 секунду и 9 действий.
Игровые агенты реального времени: демонстрация Doom TypeSafe выполняет около 10 запросов в секунду при работе со структурированным состоянием игры, стоимость составляет примерно $7 в час.
Качество и память агента
Обнаружение застоя в цикле: ProgressGate оценивает траекторию, а код возвращает CONTINUE, WARN, REPLAN или HALT.
Проверка заявления о завершении: jev-belay проверяет транскрипт на наличие доказательств, прежде чем доверять заявлению агента Claude Code о завершении.
Компактизация контекста: fast-jev-compaction оценивает вызовы инструментов и удаляет устаревшие вместо составления резюме контекста.
Извлечение трассировок для памяти: Beacon от Asymptote Labs использует Jev, чтобы определить, какие запуски в Claude Code, Codex, Cursor и OpenCode стоит превратить в повторно используемые навыки.
Семантический линтинг: jev-lint отмечает нарушения командных правил во время редактирования в Claude Code и Codex.
Модель решений на основе энкодера (ModernBERT-large)
LoRA + выходная голова на Qwen2.5-0.5B
Генеративная LLM
Веса / лицензия
Закрытая, размещённый API
Apache 2.0, 421 млн и 322 млн параметров
Apache-2.0 (базовая модель использует лицензию Qwen)
Закрытая, размещённый API
Choice / Score / Noul
Да
Да
Да
С помощью структурированных промптов
Совместимость с /v1/systemone
Нативная
Да
Да
Нет
Гарантия вывода
Привязка к схеме, без ошибок типов
Типизированные ответы по объявленным вариантам
Типизированные ответы по объявленным вариантам
0 из 3080 недействительных в тесте OpenRouter
Калибровка
Уверенность, обученная с помощью RLCD
Возвращается уровень уверенности
ECE на отложенной выборке 0,065
Оценки по промпту, гарантированная калибровка отсутствует
Максимальное число вариантов Choice
255
Снижается после 50
255
н/д
Задержка
70–500 мс (по данным поставщика); медиана 175 мс (OpenRouter)
32,8 мс на один вопрос, локально (по данным разработчиков)
~160 мс, 6 вопросов, локально (по данным разработчиков)
Медиана 2266 мс (OpenRouter)
Точность Banking77
81,0% (OpenRouter)
Несопоставимо (0,425 со значениями по умолчанию, собственный тестовый стенд)
0,860 для 77 классов (собственная отложенная выборка)
84,4% (OpenRouter)
Цена
$0,042/MTok входных данных, выходные данные бесплатны
Бесплатно, самостоятельное размещение
Бесплатно, самостоятельное размещение
$2,42 за 1000 запросов против $0,11 у Jev (OpenRouter)
Развёртывание
TypeSafe, Vercel AI Gateway, OpenRouter
pip, локальный CPU или GPU
Локальный сервер
API
Показатели открытых моделей сообщаются самими проектами на основе собственных тестовых стендов, поэтому их следует воспринимать как ориентировочные. Тест Banking77 OpenRouter — самое чистое прямое сравнение: Jev оказался на 3,3 процентного пункта менее точным, чем Claude Opus 5, в 13 раз быстрее по медианной задержке и примерно в 22 раза дешевле.
Основные выводы
Jev возвращает типизированные ответы Choice, Score и Noul с вероятностями, а не произвольный текст.
TypeSafe указывает цену $0,042 за миллион входных токенов, бесплатные выходные данные и задержку от 70 до 500 мс.
Лучшие сценарии для агентов: маршрутизация, контроль вызовов инструментов, переранжирование, проверка цитат и обнаружение инъекций.
В Banking77 Jev набрал 81,0% против 84,4% у Claude Opus 5 при в 13 раз меньшей медианной задержке.
Безопасность схемы не означает правильность: сначала откалибруйте пороги на собственном трафике.
Часто задаваемые вопросы
Что такое Jev? Jev — первая модель System One от TypeSafe AI. Она возвращает типизированные ответы Choice, Score и Noul с вероятностями вместо сгенерированного текста.
Является ли Jev заменой LLM? Нет. Он работает рядом с LLM. LLM планирует и пишет, а Jev обрабатывает ограниченные решения, такие как маршрутизация, контроль и проверка.
Сколько стоит Jev? TypeSafe указывает цену $0,042 за миллион входных токенов; выходные токены бесплатны.
Можно ли запускать Jev локально? Модель TypeSafe — нет. Открытые проекты, такие как Laya и kev, реализуют тот же интерфейс /v1/systemone на вашем собственном оборудовании.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.