TypeSafe AI випускає Jev: модель System One, що повертає типізовані, калібровані рішення замість тексту
Момент ChatGPT у 2022 році навчив ШІ розмовляти з людьми. Один із його творців тепер ставить на те, що наступним моментом стане ШІ, який розмовляє не з людьми, а з програмним забезпеченням. TypeSafe AI випустила Jev. Jev побудований на основі трансформера, але це не велика мовна модель. Він не генерує текст. Ви надсилаєте стан і типізовані запитання. Він повертає типізовані рішення з імовірностями, на основі яких код може розгалужуватися.
Чи можна його розгорнути? Так, як розміщений API на етапі раннього доступу через список очікування. TypeSafe не опублікувала ваги, кількість параметрів або можливість самостійного хостингу.
Що таке System One Model?
Назва запозичує ідею поділу Даніеля Канемана на швидку інтуїцію та повільне міркування. Команда TypeSafe стверджує, що RLHF налаштовував моделі під людські вподобання. Це породило чат, а також надмірну впевненість і випадання з режиму. Ці недоліки змушують залишати людину в контурі.
Jev використовує новий стек: нову архітектуру, паралельний семплер і навчання з підкріпленням для каліброваних рішень (RLCD). TypeSafe не розкрила архітектуру.
Як працює API Jev
Один endpoint обробляє все: POST https://api.typesafe.ai/v1/systemone. Тіло запиту містить state, model і мапу questions. У документації визначено 3 типи запитань.
| Примітив | Запитує | Повертає |
|---|---|---|
| Choice | Вибрати 1 варіант зі списку | choice, probabilities, confidence |
| Score | Оцінити за впорядкованими рівнями | score, probabilities, confidence |
| Noul | Чи правдиве це твердження? | noul, імовірність від 0 до 1 |
Запитання виконуються паралельно та ізольовано, використовуючи один і той самий стан. TypeSafe стверджує, що додавання запитань майже не змінює час відповіді. Choice підтримує до 255 варіантів.
from typesafe_sdk import Choice, Noul, TypeSafeClient
client = TypeSafeClient() # reads TYPESAFE_API_KEY
r = client.system_one(
state=ticket,
questions={
"department": Choice(
instructions="Which team should handle this",
criteria={"billing": "Payment issues", "technical": "Bugs"},
),
"is_urgent": Noul(instructions="The message conveys urgency"),
},
)
print(r.answers["department"].choice, r.answers["is_urgent"].noul)Встановіть за допомогою pip install typesafe-sdk (Python 3.10 або новішої версії). JavaScript SDK постачається як @typesafe-ai/sdk. У короткому посібнику також описано cURL і навичку агента для Claude Code.
Впевненість — це продукт
Кожна відповідь Choice і Score містить значення впевненості від 0 до 1. TypeSafe виводить його з форми розподілу ймовірностей. У прикладі з документації billing перемагає з показником 0.84. Впевненість становить лише 0.596, оскільки technical усе ще має показник 0.159.
Документація пропонує 3 підходи. Діяти за високої впевненості. Перевіряти середні значення. Передавати низьку впевненість людині. Порогові значення мають залежати від вартості неправильної дії.
Ціни, швидкість і деталі бенчмарків
Jev коштує $42 за мільярд вхідних токенів. TypeSafe вказує ціну наявних LLM на рівні від $0.20 до $10 за 1 млн вхідних токенів. У записаній демонстрації Jev завершив роботу за 0.114 с за $0.000081. GPT-5.6 Terra знадобилося 8.566 с і $0.013880.
Команда TypeSafe стверджує, що він у 193.6 раза швидший і в 444.6 раза дешевший. Ці показники отримано в результаті власних оцінювань робочих процесів TypeSafe. Але зважте на кілька моментів:
- Еталонна відповідь є середнім значенням GPT-6 Astra і Fable 5.1.
- Робочі процеси створила команда TypeSafe з оцінювання можливостей.
- TypeSafe очікує, що ці переваги проявлятимуться на верхній межі реального використання.
- TypeSafe зазначає, що не може довести, що ціна не субсидується.
«Нуль галюцинацій» означає гарантовану відповідність схемі. Показник 0% не є емпіричним. Відповіді все одно можуть бути неправильними.
Що розробники створюють за допомогою Jev
Проєкти спільноти з’явилися протягом кількох днів після запуску. Ось кілька прикладів:
- Безпека команд: генеральний директор Vercel Гільєрмо Раух повідомив, що Jev до 18 разів швидший за GPT Luna на p95 і точніший. У його дописі зазначено, що перевірка fx усе ще працювала на Luna. Інженер Праніт Шарма поділився бенчмарком.
- Сортування електронної пошти: технічний директор Bryo AI Ніхіл Мудхолкар виявив, що Gemini трохи точніший, але коштує у 10–20 разів дорожче.
- Браузерні агенти: jev-ultrafast від Browser Use виконав пошук у Google Flights за маршрутом Цюрих — Лондон за 7,1 секунди (відео).
- Телефонні агенти: mobile-jev від Droidrun керував Uber на справжньому телефоні Android: 9 дій приблизно за 21 секунду (відео). Бронювання не було завершено.
- Оцінювання відео: jevmeter оцінює кожне речення дебатів приблизно за $0.05 (демо в X).
- Оцінювання під час набору: Typewriter Стіва Кроуза оновлює 16 оцінок у міру того, як ви набираєте текст (спробувати).
- Ігри: Jev завершив першу бойову місію StarCraft (відео). Він також керує охоронцями в heist-one (відео).
- Захисні механізми агентів: jev-guard оцінює кожен виклик інструмента як заборонений, такий, що потребує запиту, або дозволений (відео тривалістю 78 секунд).
- Дані та домівки: pg-jev додає фільтри природною мовою до Postgres. HA-Jev перетворює відповіді на сутності Home Assistant.
Інтерактивне пояснення
Ключові висновки
- Jev видає типізовані рішення з імовірностями, а не рядки.
- 3 примітиви (Choice, Score, Noul) можна об’єднати в 1 запит.
- Вхідні дані коштують $0.042 за 1 млн токенів. Вихідні токени безкоштовні.
- TypeSafe повідомляє про наскрізний час відповіді від 70 мс до 500 мс.
- Основні бенчмарки виконані постачальником. Тестуйте на власних даних.
Ознайомтеся з дописом про запуск, документацією і GitHub TypeSafe. Уся заслуга належить досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого субреддіту про машинне навчання зі 150 тис.+ учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.
Потрібно співпрацювати з нами для просування вашого GitHub-репозиторію, сторінки на Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.