Миналата седмица TypeSafe AI представи Jev, първия си модел System One. Преди това основателят Диого Алмейда е работил в OpenAI по изследванията за следване на инструкции, стоящи зад ChatGPT.
Jev не води разговори, не пише код и не обобщава. Той приема неструктурирано състояние и връща типизирани решения с калибрирани вероятности. Това го прави естествен избор за хилядите малки преценки в рамките на един агентен цикъл: кой модел да бъде извикан, дали дадена команда е безопасна, кой откъс е релевантен, дали агентът действително е приключил.
Как работи Jev
Всяко извикване изпраща state (текст или JSON), заедно с речник от типизирани въпроси. Документацията на TypeSafe определя 3 примитива:
Choice избира една опция от списък и връща вероятност за всяка опция, както и увереност.
Score оценява състоянието по нива на подредена рубрика и връща вероятности и увереност.
Noul връща вероятността (от 0 до 1), че дадено твърдение е вярно.
Всички въпроси се оценяват паралелно спрямо едно и също състояние в рамките на една заявка. TypeSafe обучава Jev с Reinforcement Learning for Calibrated Decisions (RLCD), така че по-високата увереност да съответства на по-висока точност. Choice поддържа до 255 опции.
Основните твърдения — 193,6 пъти по-бърз и 444,6 пъти по-евтин — произлизат от собствените оценки на работни процеси на TypeSafe. В публикацията за представянето се посочва, че тези стойности са в горния диапазон на реалните подобрения и използват GPT-6 Astra и Fable 5.1 като референтен отговор.
Сравнете LLM модел, генериращ токени един по един, с еднократното изпълнение на Jev, преместете прага на увереност, за да видите как кодът управлява всяко решение, изчислете месечните разходи и разгледайте всички 20 случая на употреба.
20 агентни случая на употреба за Jev
Маршрутизиране и оркестрация
Маршрутизиране на модели: Оценете трудността на заявката, след което я изпратете към бърз или силен модел. LangChain предоставя това като ModelRouterMiddleware; jev-router го прави за всеки ход в Claude Code и Codex.
Типизирано извикване на функции: Готварската книга за извикване на функции преобразува заявки за търговия на естествен език в имена на функции и аргументи от затворено множество, като използва праг на увереност.
Сортиране на заявки и маршрутизиране по намерение: Едно извикване връща отдела, неудовлетвореността и спешността. Моделът за маршрутизиране по намерение изпраща всяка заявка към детерминистична логика, специализиран LLM или човек.
Безопасност и ограничители
Контрол на риска при извикване на инструменти: pi-warden пита дали предстоящ bash, запис или редактиране е необратимо или извън задачата. Той различава db:reset след „нулирай базата данни“ от db:reset след „добави колона“. AutoModeMiddleware на LangChain връща грешка при рискови извиквания.
Автоматично одобрение само за четене: jev-auto-approve е hook за Claude Code, който одобрява автоматично само при p ≥ 0,95 и е одобрил 0 от 8 команди, променящи състоянието, в публикуваната си калибрация.
Защита от изтичане на тайни: jev-secret-guard изпраща маскирани низове към Jev и е блокирал 6 от 6 тайни и 0 от 6 доброкачествени низа в своята калибрация.
Проверка за prompt injection: В готварската книга за RAG откъси на TypeSafe косинусната близост е поставила нарочно добавената инжекция на първо място с 0,584. Jev я е оценил с 0,99 и я е отхвърлил.
Ограничители за входа и изхода на LLM: Готварската книга за ограничители задава прагове за вероятностите за опасност, за да пропуска, преглежда, блокира или маршрутизира всяко съобщение.
Извличане и заземяване
Преподреждане: При 40 правни заявки от CLERC готварската книга за преподреждане повишава точността top-1 от 5% на 18%, а top-10 — от 38% на 62%.
Проверка на цитати: Готварската книга за проверка на цитати използва един Choice, за да определи дали даден раздел от източник подкрепя, противоречи или не казва нищо за твърдение.
Компютърно, браузърно управление и управление в реално време
Браузърни агенти: Jev Ultrafast на Browser Use избира операция и DOM елемент в една заявка и завършва търсене на Google Flights за около 7,1 секунди.
Използване на настолен компютър: typesafe-computer-use извлича текста от екрана на macOS чрез OCR и позволява на Jev да класифицира следващото действие за около $0,0002 на стъпка.
Мобилни агенти: Mobile Jev решава всяко докосване в Android, достигайки екрана за плащане на Uber за около 21 секунди и 9 действия.
Игрови агенти в реално време: Демонстрацията с Doom на TypeSafe изпълнява около 10 заявки в секунда, на приблизителна цена от $7 на час, върху структурирано състояние на играта.
Качество и памет на агента
Откриване на застой в цикъла: ProgressGate оценява траекторията, а кодът връща CONTINUE, WARN, REPLAN или HALT.
Проверка на твърдението „Готово“: jev-belay проверява транскрипцията за доказателства, преди да се довери на твърдението на агент на Claude Code, че е „готов“.
Компресиране на контекста: fast-jev-compaction оценява извикванията на инструменти и премахва остарелите, вместо да обобщава контекста.
Извличане на трасета за памет: Beacon by Asymptote Labs използва Jev, за да открие кои изпълнения в Claude Code, Codex, Cursor и OpenCode си струва да бъдат превърнати в многократно използваеми умения.
Семантичен linting: jev-lint маркира нарушенията на екипните правила при редактиране за Claude Code и Codex.
70 до 500 мс (доставчик); медиана 175 мс (OpenRouter)
32,8 мс за един въпрос, локално (самоотчетено)
~160 мс, 6 въпроса, локално (самоотчетено)
Медиана 2 266 мс (OpenRouter)
Точност при Banking77
81,0% (OpenRouter)
Несъпоставима (0,425 по подразбиране, собствен harness)
0,860 при 77 класа (собствен задържан набор)
84,4% (OpenRouter)
Цена
$0,042/MTok вход, безплатен изход
Безплатен, самостоятелно хостван
Безплатен, самостоятелно хостван
$2,42 на 1 000 заявки срещу $0,11 за Jev (OpenRouter)
Внедряване
TypeSafe, Vercel AI Gateway, OpenRouter
pip, локален CPU или GPU
Локален сървър
API
Данните за моделите с отворен код са самоотчетени от всеки проект чрез собствен harness, затова ги приемайте като ориентировъчни. Тестът Banking77 на OpenRouter е най-чистото директно сравнение: Jev е с 3,3 процентни пункта по-малко точен от Claude Opus 5, 13 пъти по-бърз по медианна стойност и струва приблизително 1/22 от цената.
Основни изводи
Jev връща типизирани отговори Choice, Score и Noul с вероятности, никога свободен текст.
TypeSafe посочва цена от $0,042 на милион входни токени, безплатен изход и латентност от 70 до 500 мс.
Най-подходящи приложения за агенти: маршрутизиране, контрол на извикванията на инструменти, преподреждане, проверка на цитати и проверка за инжекции.
При Banking77 Jev постига 81,0% спрямо 84,4% за Claude Opus 5, при 13 пъти по-ниска медианна латентност.
Безопасността на схемата не означава коректност: първо калибрирайте праговете върху собствените си данни.
Често задавани въпроси
Какво е Jev? Jev е първият модел System One на TypeSafe AI. Той връща типизирани отговори Choice, Score и Noul с вероятности, вместо генериран текст.
Jev заместител ли е на LLM? Не. Той работи редом до LLM. LLM планира и пише, а Jev обработва ограничени решения като маршрутизиране, контрол и проверка.
Колко струва Jev? TypeSafe посочва $0,042 на милион входни токени, като изходните токени са безплатни.
Мога ли да стартирам Jev локално? Не и модела на TypeSafe. Отворени проекти като Laya и kev прилагат същия интерфейс /v1/systemone върху вашия собствен хардуер.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.