Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

TypeSafe AI пуска Jev: модел System One, който връща типизирани, калибрирани решения вместо текст

Моментът на ChatGPT през 2022 г. научи изкуствения интелект да разговаря с хора. Един от създателите му сега залага, че следващият момент ще бъде този, в който ИИ разговаря със софтуер, а не с хора. TypeSafe AI представи Jev. Jev е базиран на трансформър, но не е голям езиков модел. Той не генерира текст. Изпращате му състояние и типизирани въпроси. Той връща типизирани решения с вероятности, въз основа на които кодът може да избира различни разклонения.

Може ли да бъде внедрен? Да, като хостван API в ранен достъп чрез списък с чакащи. TypeSafe не е публикувала теглата, броя на параметрите или възможност за самостоятелно хостване.

Какво представлява моделът System One?

Името заимства разделението на Даниел Канеман между бързата интуиция и бавното разсъждение. Екипът на TypeSafe твърди, че RLHF е настроил моделите за човешки предпочитания. Това е довело до чат, както и до свръхувереност и отпадане на режими. Тези недостатъци задържат човек в процеса.

Jev използва нов стек: нова архитектура, паралелен семплер и обучение с подсилване за калибрирани решения (RLCD). TypeSafe не е разкрила архитектурата.

Как работи API на Jev

Една крайна точка обработва всичко: POST https://api.typesafe.ai/v1/systemone. Тялото съдържа state, model и карта от questions. Документацията определя 3 типа въпроси.

ПримитивПитаВръща
ChoiceИзбира 1 опция от списъкchoice, probabilities, confidence
ScoreОценява спрямо подредени ниваscore, probabilities, confidence
NoulВярно ли е това твърдение?noul, вероятност от 0 до 1

Въпросите се изпълняват паралелно и независимо един от друг, като използват едно и също състояние. TypeSafe твърди, че добавянето на въпроси почти не променя времето за отговор. Един Choice поддържа до 255 опции.

Копиране на кодаКопираноИзползвайте друг браузър
from typesafe_sdk import Choice, Noul, TypeSafeClient

client = TypeSafeClient()  # reads TYPESAFE_API_KEY
r = client.system_one(
    state=ticket,
    questions={
        "department": Choice(
            instructions="Which team should handle this",
            criteria={"billing": "Payment issues", "technical": "Bugs"},
        ),
        "is_urgent": Noul(instructions="The message conveys urgency"),
    },
)
print(r.answers["department"].choice, r.answers["is_urgent"].noul)

Инсталирайте с pip install typesafe-sdk (Python 3.10 или по-нова версия). JavaScript SDK се предлага като @typesafe-ai/sdk. Ръководството за бърз старт обхваща също cURL и умение за агент за Claude Code.

Увереността е продуктът

Всеки отговор на Choice и Score съдържа стойност за увереност от 0 до 1. TypeSafe я извежда от формата на разпределението на вероятностите. В примера от документацията billing печели с 0.84. Увереността е само 0.596, тъй като technical все още има 0.159.

Документацията предлага 3 подхода. Действайте при висока увереност. Преглеждайте средните стойности. Изпращайте ниската увереност на човек. Праговете трябва да се съобразяват с цената на грешното действие.

Цена, скорост и дребният шрифт при бенчмарковете

Jev струва 42 долара на милиард входни токени. TypeSafe посочва цена от 0,20 до 10 долара за 1 млн. входни токена при съществуващите LLM. В записаната си демонстрация Jev завършва за 0,114 сек. при цена 0,000081 долара. GPT-5.6 Terra отнема 8,566 сек. при цена 0,013880 долара.

Екипът на TypeSafe твърди, че е 193,6 пъти по-бърз и 444,6 пъти по-евтин. Тези цифри идват от собствените на TypeSafe оценки на работни процеси. Но нека спрем дотук — ето няколко неща, които трябва да имате предвид:

  • Референтният отговор е средната стойност на GPT-6 Astra и Fable 5.1.
  • Работните процеси са написани от екипа на TypeSafe за оценка на възможностите.
  • TypeSafe очаква тези предимства да се проявяват в най-голяма степен при реална употреба.
  • TypeSafe казва, че не може да докаже, че цената не е субсидирана.

„Нулеви халюцинации“ означава, че съвпадението със схемата е гарантирано. Стойността от 0% не е емпирична. Отговорите все още могат да бъдат грешни.

Какво създават разработчиците с Jev

Само дни след старта се появиха проекти от общността. Ето няколко примера:

  • Безопасност на командите: Главният изпълнителен директор на Vercel Гийермо Раух съобщи, че Jev е до 18 пъти по-бърз при p95 от GPT Luna и е по-точен. В публикацията му се казва, че проверката на fx все още се изпълнява на Luna. Инженерът Пранит Шарма сподели бенчмарка.
  • Сортиране на имейли: Техническият директор на Bryo AI Нихил Мудхолкар установи, че Gemini е малко по-точен, но струва 10 до 20 пъти повече.
  • Браузърни агенти: jev-ultrafast на Browser Use извърши търсене на полети в Google Flights от Цюрих до Лондон за 7,1 секунди (видео).
  • Телефонни агенти: mobile-jev на Droidrun управлява Uber на истински телефон с Android: 9 действия за около 21 секунди (видео). Не е извършена резервация.
  • Оценяване на видео: jevmeter оценява всяко изречение от дебат за около 0,05 долара (демонстрация в X).
  • Въвеждане в реално време: Typewriter на Стив Краус актуализира 16 преценки, докато пишете (изпробвайте го).
  • Игри: Jev завърши първата бойна мисия в StarCraft (видео). Той управлява и охраната в heist-one (видео).
  • Ограничители за агенти: jev-guard оценява всяко извикване на инструмент като забранено, изискващо потвърждение или разрешено (78-секундно видео).
  • Данни и домове: pg-jev добавя филтри на разбираем език към Postgres. HA-Jev превръща отговорите в обекти на Home Assistant.

Интерактивно обяснение

Основни изводи

  • Jev извежда типизирани решения с вероятности, а не низове.
  • 3 примитива (Choice, Score, Noul) могат да споделят 1 заявка.
  • Входът струва 0,042 долара за 1 млн. токена. Изходните токени са безплатни.
  • TypeSafe отчита време за отговор от край до край между 70 и 500 мс.
  • Основните бенчмаркове са проведени от доставчика. Тествайте със собствените си данни.

Вижте публикацията за старта, документацията и GitHub хранилището на TypeSafe. Всички заслуги са за изследователя на този проект. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия 150k+ ML SubReddit и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.

Имате нужда от партньор за популяризирането на вашето GitHub хранилище, страница в Hugging Face, продуктова премиера, уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини