TypeSafe AI пуска Jev: модел System One, който връща типизирани, калибрирани решения вместо текст
Моментът на ChatGPT през 2022 г. научи изкуствения интелект да разговаря с хора. Един от създателите му сега залага, че следващият момент ще бъде този, в който ИИ разговаря със софтуер, а не с хора. TypeSafe AI представи Jev. Jev е базиран на трансформър, но не е голям езиков модел. Той не генерира текст. Изпращате му състояние и типизирани въпроси. Той връща типизирани решения с вероятности, въз основа на които кодът може да избира различни разклонения.
Може ли да бъде внедрен? Да, като хостван API в ранен достъп чрез списък с чакащи. TypeSafe не е публикувала теглата, броя на параметрите или възможност за самостоятелно хостване.
Какво представлява моделът System One?
Името заимства разделението на Даниел Канеман между бързата интуиция и бавното разсъждение. Екипът на TypeSafe твърди, че RLHF е настроил моделите за човешки предпочитания. Това е довело до чат, както и до свръхувереност и отпадане на режими. Тези недостатъци задържат човек в процеса.
Jev използва нов стек: нова архитектура, паралелен семплер и обучение с подсилване за калибрирани решения (RLCD). TypeSafe не е разкрила архитектурата.
Как работи API на Jev
Една крайна точка обработва всичко: POST https://api.typesafe.ai/v1/systemone. Тялото съдържа state, model и карта от questions. Документацията определя 3 типа въпроси.
| Примитив | Пита | Връща |
|---|---|---|
| Choice | Избира 1 опция от списък | choice, probabilities, confidence |
| Score | Оценява спрямо подредени нива | score, probabilities, confidence |
| Noul | Вярно ли е това твърдение? | noul, вероятност от 0 до 1 |
Въпросите се изпълняват паралелно и независимо един от друг, като използват едно и също състояние. TypeSafe твърди, че добавянето на въпроси почти не променя времето за отговор. Един Choice поддържа до 255 опции.
from typesafe_sdk import Choice, Noul, TypeSafeClient
client = TypeSafeClient() # reads TYPESAFE_API_KEY
r = client.system_one(
state=ticket,
questions={
"department": Choice(
instructions="Which team should handle this",
criteria={"billing": "Payment issues", "technical": "Bugs"},
),
"is_urgent": Noul(instructions="The message conveys urgency"),
},
)
print(r.answers["department"].choice, r.answers["is_urgent"].noul)Инсталирайте с pip install typesafe-sdk (Python 3.10 или по-нова версия). JavaScript SDK се предлага като @typesafe-ai/sdk. Ръководството за бърз старт обхваща също cURL и умение за агент за Claude Code.
Увереността е продуктът
Всеки отговор на Choice и Score съдържа стойност за увереност от 0 до 1. TypeSafe я извежда от формата на разпределението на вероятностите. В примера от документацията billing печели с 0.84. Увереността е само 0.596, тъй като technical все още има 0.159.
Документацията предлага 3 подхода. Действайте при висока увереност. Преглеждайте средните стойности. Изпращайте ниската увереност на човек. Праговете трябва да се съобразяват с цената на грешното действие.
Цена, скорост и дребният шрифт при бенчмарковете
Jev струва 42 долара на милиард входни токени. TypeSafe посочва цена от 0,20 до 10 долара за 1 млн. входни токена при съществуващите LLM. В записаната си демонстрация Jev завършва за 0,114 сек. при цена 0,000081 долара. GPT-5.6 Terra отнема 8,566 сек. при цена 0,013880 долара.
Екипът на TypeSafe твърди, че е 193,6 пъти по-бърз и 444,6 пъти по-евтин. Тези цифри идват от собствените на TypeSafe оценки на работни процеси. Но нека спрем дотук — ето няколко неща, които трябва да имате предвид:
- Референтният отговор е средната стойност на GPT-6 Astra и Fable 5.1.
- Работните процеси са написани от екипа на TypeSafe за оценка на възможностите.
- TypeSafe очаква тези предимства да се проявяват в най-голяма степен при реална употреба.
- TypeSafe казва, че не може да докаже, че цената не е субсидирана.
„Нулеви халюцинации“ означава, че съвпадението със схемата е гарантирано. Стойността от 0% не е емпирична. Отговорите все още могат да бъдат грешни.
Какво създават разработчиците с Jev
Само дни след старта се появиха проекти от общността. Ето няколко примера:
- Безопасност на командите: Главният изпълнителен директор на Vercel Гийермо Раух съобщи, че Jev е до 18 пъти по-бърз при p95 от GPT Luna и е по-точен. В публикацията му се казва, че проверката на fx все още се изпълнява на Luna. Инженерът Пранит Шарма сподели бенчмарка.
- Сортиране на имейли: Техническият директор на Bryo AI Нихил Мудхолкар установи, че Gemini е малко по-точен, но струва 10 до 20 пъти повече.
- Браузърни агенти: jev-ultrafast на Browser Use извърши търсене на полети в Google Flights от Цюрих до Лондон за 7,1 секунди (видео).
- Телефонни агенти: mobile-jev на Droidrun управлява Uber на истински телефон с Android: 9 действия за около 21 секунди (видео). Не е извършена резервация.
- Оценяване на видео: jevmeter оценява всяко изречение от дебат за около 0,05 долара (демонстрация в X).
- Въвеждане в реално време: Typewriter на Стив Краус актуализира 16 преценки, докато пишете (изпробвайте го).
- Игри: Jev завърши първата бойна мисия в StarCraft (видео). Той управлява и охраната в heist-one (видео).
- Ограничители за агенти: jev-guard оценява всяко извикване на инструмент като забранено, изискващо потвърждение или разрешено (78-секундно видео).
- Данни и домове: pg-jev добавя филтри на разбираем език към Postgres. HA-Jev превръща отговорите в обекти на Home Assistant.
Интерактивно обяснение
Основни изводи
- Jev извежда типизирани решения с вероятности, а не низове.
- 3 примитива (Choice, Score, Noul) могат да споделят 1 заявка.
- Входът струва 0,042 долара за 1 млн. токена. Изходните токени са безплатни.
- TypeSafe отчита време за отговор от край до край между 70 и 500 мс.
- Основните бенчмаркове са проведени от доставчика. Тествайте със собствените си данни.
Вижте публикацията за старта, документацията и GitHub хранилището на TypeSafe. Всички заслуги са за изследователя на този проект. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия 150k+ ML SubReddit и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.
Имате нужда от партньор за популяризирането на вашето GitHub хранилище, страница в Hugging Face, продуктова премиера, уебинар и т.н.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.