20 агентних сценаріїв використання Jev від TypeSafe AI
MarkTechPost·10 хв читання
Минулого тижня TypeSafe AI випустила Jev, свою першу модель System One. Засновник Діого Алмейда раніше працював в OpenAI над дослідженнями дотримання інструкцій, що лежать в основі ChatGPT.
Jev не веде діалоги, не пише код і не створює резюме. Він отримує неструктурований стан і повертає типізовані рішення з відкаліброваними ймовірностями. Це робить його природним вибором для тисяч невеликих оцінок усередині циклу агента: яку модель викликати, чи безпечна команда, який фрагмент релевантний, чи агент справді завершив роботу.
Як працює Jev
Кожен виклик надсилає state (текст або JSON) і словник типізованих запитань. Документація TypeSafe визначає 3 примітиви:
Choice обирає один варіант зі списку та повертає ймовірність для кожного варіанта разом із рівнем упевненості.
Score оцінює стан за впорядкованими рівнями критерію та повертає ймовірності й рівень упевненості.
Noul повертає ймовірність (від 0 до 1) того, що твердження є істинним.
Усі запитання оцінюються паралельно щодо одного й того самого стану в одному запиті. TypeSafe навчає Jev за допомогою підкріплювального навчання для каліброваних рішень (RLCD), тож вища впевненість має відповідати вищій точності. Choice підтримує до 255 варіантів.
Основні заяви — у 193,6 раза швидше та в 444,6 раза дешевше — ґрунтуються на власних оцінюваннях робочих процесів TypeSafe. У публікації про запуск зазначено, що ці показники перебувають у верхній межі реальних результатів і використовують GPT-6 Astra та Fable 5.1 як еталонні відповіді.
Порівняйте швидкість генерації токенів LLM один за одним із одним проходом Jev, змініть поріг упевненості, щоб побачити, як код контролює кожне рішення, оцініть місячну вартість і перегляньте всі 20 варіантів використання.
20 варіантів використання Jev в агентних системах
Маршрутизація та оркестрація
Маршрутизація моделей: Оцініть складність запиту, а потім передайте його швидкій або потужній моделі. LangChain постачає це як ModelRouterMiddleware; jev-router робить це для кожного ходу в Claude Code і Codex.
Типізований виклик функцій: кулінарна книга для виклику функцій зіставляє торгові запити природною мовою з назвами функцій і аргументами із закритого набору, використовуючи поріг упевненості.
Сортування тікетів і маршрутизація за наміром: Один виклик повертає відділ, рівень роздратування й терміновість. Шаблон маршрутизації за наміром передає кожен запит детермінованій логіці, спеціалізованій LLM або людині.
Безпека та захисні обмеження
Контроль ризику виклику інструмента: pi-warden запитує, чи є запланована команда bash, запис або редагування незворотними чи такими, що не відповідають завданню. Він розрізняє db:reset після «скинути базу даних» і db:reset після «додати стовпець». AutoModeMiddleware LangChain повертає помилку для ризикованих викликів.
Автоматичне схвалення лише для читання: jev-auto-approve — це хук Claude Code, який автоматично схвалює лише дії з p ≥ 0,95 і під час опублікованого калібрування схвалив 0 із 8 команд, що змінюють стан.
Захист від витоку секретів: jev-secret-guard надсилає замасковані рядки до Jev і під час калібрування заблокував 6 із 6 секретів і 0 із 6 нешкідливих рядків.
Перевірка на ін’єкції в промпт: У кулінарній книзі TypeSafe для RAG-фрагментів косинусна подібність поставила навмисно додану ін’єкцію на перше місце з показником 0,584. Jev оцінив її в 0,99 і відкинув.
Захисні обмеження для введення та виведення LLM: кулінарна книга захисних обмежень використовує пороги ймовірностей небезпеки, щоб пропускати, перевіряти, блокувати або маршрутизувати кожне повідомлення.
Пошук і заземлення
Переранжування: На 40 юридичних запитах CLERC кулінарна книга переранжування підвищила точність top-1 з 5% до 18%, а top-10 — з 38% до 62%.
Перевірка цитувань: кулінарна книга перевірки цитувань використовує один Choice, щоб визначити, чи підтверджує джерело твердження, суперечить йому або нічого про нього не говорить.
Керування комп’ютером, браузером і системами реального часу
Браузерні агенти: Jev Ultrafast від Browser Use обирає операцію та елемент DOM в одному запиті й завершує пошук Google Flights приблизно за 7,1 секунди.
Використання настільного комп’ютера: typesafe-computer-use розпізнає екран macOS і дозволяє Jev класифікувати наступну дію приблизно за $0,0002 на крок.
Мобільні агенти: Mobile Jev визначає кожне натискання в Android, досягаючи екрана оплати Uber приблизно за 21 секунду та 9 дій.
Ігрові агенти реального часу: демонстрація Doom від TypeSafe виконує приблизно 10 запитів на секунду за структурованим станом гри, витрачаючи близько $7 на годину.
Якість агентів і пам’ять
Виявлення застою в циклі: ProgressGate оцінює траєкторію, а код повертає CONTINUE, WARN, REPLAN або HALT.
Перевірка заяви «готово»: jev-belay перевіряє стенограму на докази, перш ніж довіритися заяві агента Claude Code про завершення.
Стиснення контексту: fast-jev-compaction оцінює виклики інструментів і видаляє застарілі замість узагальнення контексту.
Видобування трас для пам’яті: Beacon від Asymptote Labs використовує Jev, щоб визначити, які запуски в Claude Code, Codex, Cursor і OpenCode варто перетворити на багаторазово використовувані навички.
Семантичний лінтинг: jev-lint позначає порушення командних правил під час редагування в Claude Code і Codex.
32,8 мс для одного запитання, локально (за власними даними)
~160 мс, 6 запитань, локально (за власними даними)
Медіана 2 266 мс (OpenRouter)
Точність Banking77
81,0% (OpenRouter)
Непорівнянно (0,425 за замовчуванням, власний стенд)
0,860 для 77 класів (власна відкладена вибірка)
84,4% (OpenRouter)
Ціна
$0,042/MTok вхідних даних, вихідні безкоштовні
Безкоштовна, самостійний хостинг
Безкоштовна, самостійний хостинг
$2,42 за 1 000 запитів проти $0,11 для Jev (OpenRouter)
Розгортання
TypeSafe, Vercel AI Gateway, OpenRouter
pip, локальний CPU або GPU
Локальний сервер
API
Показники відкритих моделей кожен проєкт наводить на власному стенді, тому сприймайте їх як орієнтовні. Тест Banking77 OpenRouter є найчистішим прямим порівнянням: Jev був на 3,3 процентного пункта менш точним за Claude Opus 5, у 13 разів швидшим за медіанною затримкою та приблизно в 22 рази дешевшим.
Основні висновки
Jev повертає типізовані відповіді Choice, Score і Noul із ймовірностями, а не довільний текст.
TypeSafe вказує ціну $0,042 за мільйон вхідних токенів, безкоштовні вихідні дані та затримку від 70 до 500 мс.
Найкращі варіанти застосування в агентних системах: маршрутизація, контроль викликів інструментів, переранжування, перевірка цитувань і виявлення ін’єкцій.
У Banking77 Jev отримав 81,0% проти 84,4% у Claude Opus 5, маючи в 13 разів меншу медіанну затримку.
Безпечна схема не означає правильний результат: спочатку відкалібруйте пороги на власному трафіку.
Поширені запитання
Що таке Jev? Jev — перша модель System One від TypeSafe AI. Вона повертає типізовані відповіді Choice, Score і Noul із ймовірностями замість згенерованого тексту.
Чи є Jev заміною LLM? Ні. Він працює поруч із LLM. LLM планує та пише, а Jev обробляє обмежені рішення, як-от маршрутизація, контроль і перевірка.
Скільки коштує Jev? TypeSafe вказує ціну $0,042 за мільйон вхідних токенів, а вихідні токени безкоштовні.
Чи можна запускати Jev локально? Модель TypeSafe — ні. Відкриті проєкти, як-от Laya і kev, реалізують той самий інтерфейс /v1/systemone на вашому обладнанні.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.