TypeSafe AI выпускает Jev: модель System One, возвращающую типизированные, калиброванные решения вместо текста
Момент ChatGPT в 2022 году научил ИИ разговаривать с людьми. Теперь один из его создателей делает ставку на то, что следующим важным моментом станет ИИ, который будет взаимодействовать не с людьми, а с программным обеспечением. TypeSafe AI выпустила Jev. Jev основан на архитектуре трансформеров, но не является большой языковой моделью. Он не генерирует текст. Вы отправляете ему состояние и типизированные вопросы. В ответ он возвращает типизированные решения с вероятностями, на основе которых код может выбирать дальнейшую ветвь выполнения.
Можно ли его развернуть? Да, в виде размещённого API на этапе раннего доступа по списку ожидания. TypeSafe не опубликовала веса, количество параметров или возможность самостоятельного хостинга.
Что такое модель System One?
Название отсылает к разделению Даниэлем Канеманом быстрого интуитивного и медленного рационального мышления. В команде TypeSafe считают, что RLHF настраивал модели под человеческие предпочтения. Это привело к появлению чат-ботов, а также к излишней уверенности и выпадению режимов. Из-за этих недостатков человек по-прежнему должен участвовать в процессе.
Jev использует новый стек: новую архитектуру, параллельный сэмплер и обучение с подкреплением для калиброванных решений (RLCD). TypeSafe не раскрыла архитектуру.
Как работает API Jev
Один эндпоинт обрабатывает всё: POST https://api.typesafe.ai/v1/systemone. Тело запроса содержит state, model и карту questions. В документации определены 3 типа вопросов.
| Примитив | Что делает | Что возвращает |
|---|---|---|
| Choice | Выбирает 1 вариант из списка | choice, probabilities, confidence |
| Score | Оценивает по упорядоченным уровням | score, probabilities, confidence |
| Noul | Верно ли это утверждение? | noul, вероятность от 0 до 1 |
Вопросы выполняются параллельно и независимо друг от друга, используя одно и то же состояние. TypeSafe утверждает, что добавление вопросов почти не влияет на время ответа. Choice поддерживает до 255 вариантов.
from typesafe_sdk import Choice, Noul, TypeSafeClient
client = TypeSafeClient() # reads TYPESAFE_API_KEY
r = client.system_one(
state=ticket,
questions={
"department": Choice(
instructions="Which team should handle this",
criteria={"billing": "Payment issues", "technical": "Bugs"},
),
"is_urgent": Noul(instructions="The message conveys urgency"),
},
)
print(r.answers["department"].choice, r.answers["is_urgent"].noul)Установите пакет с помощью pip install typesafe-sdk (Python 3.10 или новее). JavaScript SDK поставляется как @typesafe-ai/sdk. В кратком руководстве также рассматриваются cURL и навык агента для Claude Code.
Уверенность — это продукт
Каждый ответ Choice и Score содержит значение уверенности от 0 до 1. TypeSafe вычисляет его на основе формы распределения вероятностей. В примере из документации вариант billing побеждает с результатом 0.84. Уверенность составляет всего 0.596, поскольку на technical по-прежнему приходится 0.159.
В документации предлагаются 3 сценария. Действуйте при высокой уверенности. Проверяйте результаты со средней уверенностью. Передавайте результаты с низкой уверенностью человеку. Пороговые значения должны зависеть от цены ошибочного действия.
Цена, скорость и детали бенчмарка
Jev стоит $42 за миллиард входных токенов. TypeSafe указывает стоимость существующих LLM на уровне от $0.20 до $10 за 1 млн входных токенов. В записанной демонстрации Jev завершил задачу за 0.114 с при стоимости $0.000081. GPT-5.6 Terra потребовалось 8.566 с при стоимости $0.013880.
Команда TypeSafe утверждает, что Jev в 193.6 раза быстрее и в 444.6 раза дешевле. Эти цифры получены в собственных тестах рабочих процессов TypeSafe. Но здесь стоит остановиться и учесть несколько моментов:
- Эталонный ответ представляет собой среднее значение для GPT-6 Astra и Fable 5.1.
- Рабочие процессы написаны командой TypeSafe, отвечающей за оценку возможностей.
- TypeSafe ожидает, что такие преимущества будут проявляться в основном на верхнем пределе реального использования.
- TypeSafe заявляет, что не может доказать отсутствие субсидирования цены.
«Нулевые галлюцинации» означают, что соответствие схеме гарантировано. Показатель 0% не является эмпирическим. Ответы всё ещё могут быть неверными.
Что разработчики создают с помощью Jev
Проекты сообщества начали появляться уже через несколько дней после запуска. Вот несколько примеров:
- Безопасность команд: генеральный директор Vercel Гильермо Раух сообщил, что Jev оказался до 18 раз быстрее GPT Luna по показателю p95 и точнее. В его публикации говорится, что проверка fx по-прежнему выполнялась на Luna. Инженер Пранийт Шарма поделился результатами бенчмарка.
- Сортировка электронной почты: технический директор Bryo AI Никхил Мудхолкар обнаружил, что Gemini немного точнее, но стоит в 10–20 раз дороже.
- Браузерные агенты: jev-ultrafast от Browser Use выполнил поиск рейсов Google Flights из Цюриха в Лондон за 7,1 секунды (видео).
- Телефонные агенты: mobile-jev от Droidrun управлял Uber на реальном телефоне Android: 9 действий примерно за 21 секунду (видео). Бронирование завершено не было.
- Оценка видео: jevmeter оценивает каждое предложение в дебатах примерно за $0.05 (демонстрация в X).
- Ввод в реальном времени: Typewriter Стива Крауза обновляет 16 оценок по мере ввода текста (попробовать).
- Игры: Jev завершил первую боевую миссию StarCraft (видео). Он также управляет охранниками в heist-one (видео).
- Ограничения для агентов: jev-guard оценивает каждый вызов инструмента как запрещённый, требующий подтверждения или разрешённый (видео продолжительностью 78 секунд).
- Данные и дома: pg-jev добавляет фильтры на естественном языке в Postgres. HA-Jev превращает ответы в сущности Home Assistant.
Интерактивное объяснение
Основные выводы
- Jev выдаёт типизированные решения с вероятностями, а не строки.
- 3 примитива (Choice, Score, Noul) можно объединить в 1 запросе.
- Входные данные стоят $0.042 за 1 млн токенов. Выходные токены бесплатны.
- TypeSafe заявляет сквозное время ответа от 70 до 500 мс.
- Основные бенчмарки проводились поставщиком. Тестируйте систему на собственных данных.
Ознакомьтесь с публикацией о запуске, документацией и GitHub TypeSafe. Вся благодарность — исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему 150k+ ML SubReddit и подписаться на нашу рассылку. Стоп! Вы пользуетесь Telegram? теперь к нам можно присоединиться и в Telegram.
Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.