Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

TypeSafe AI выпускает Jev: модель System One, возвращающую типизированные, калиброванные решения вместо текста

Момент ChatGPT в 2022 году научил ИИ разговаривать с людьми. Теперь один из его создателей делает ставку на то, что следующим важным моментом станет ИИ, который будет взаимодействовать не с людьми, а с программным обеспечением. TypeSafe AI выпустила Jev. Jev основан на архитектуре трансформеров, но не является большой языковой моделью. Он не генерирует текст. Вы отправляете ему состояние и типизированные вопросы. В ответ он возвращает типизированные решения с вероятностями, на основе которых код может выбирать дальнейшую ветвь выполнения.

Можно ли его развернуть? Да, в виде размещённого API на этапе раннего доступа по списку ожидания. TypeSafe не опубликовала веса, количество параметров или возможность самостоятельного хостинга.

Что такое модель System One?

Название отсылает к разделению Даниэлем Канеманом быстрого интуитивного и медленного рационального мышления. В команде TypeSafe считают, что RLHF настраивал модели под человеческие предпочтения. Это привело к появлению чат-ботов, а также к излишней уверенности и выпадению режимов. Из-за этих недостатков человек по-прежнему должен участвовать в процессе.

Jev использует новый стек: новую архитектуру, параллельный сэмплер и обучение с подкреплением для калиброванных решений (RLCD). TypeSafe не раскрыла архитектуру.

Как работает API Jev

Один эндпоинт обрабатывает всё: POST https://api.typesafe.ai/v1/systemone. Тело запроса содержит state, model и карту questions. В документации определены 3 типа вопросов.

ПримитивЧто делаетЧто возвращает
ChoiceВыбирает 1 вариант из спискаchoice, probabilities, confidence
ScoreОценивает по упорядоченным уровнямscore, probabilities, confidence
NoulВерно ли это утверждение?noul, вероятность от 0 до 1

Вопросы выполняются параллельно и независимо друг от друга, используя одно и то же состояние. TypeSafe утверждает, что добавление вопросов почти не влияет на время ответа. Choice поддерживает до 255 вариантов.

Копировать кодСкопированоИспользовать другой браузер
from typesafe_sdk import Choice, Noul, TypeSafeClient

client = TypeSafeClient()  # reads TYPESAFE_API_KEY
r = client.system_one(
    state=ticket,
    questions={
        "department": Choice(
            instructions="Which team should handle this",
            criteria={"billing": "Payment issues", "technical": "Bugs"},
        ),
        "is_urgent": Noul(instructions="The message conveys urgency"),
    },
)
print(r.answers["department"].choice, r.answers["is_urgent"].noul)

Установите пакет с помощью pip install typesafe-sdk (Python 3.10 или новее). JavaScript SDK поставляется как @typesafe-ai/sdk. В кратком руководстве также рассматриваются cURL и навык агента для Claude Code.

Уверенность — это продукт

Каждый ответ Choice и Score содержит значение уверенности от 0 до 1. TypeSafe вычисляет его на основе формы распределения вероятностей. В примере из документации вариант billing побеждает с результатом 0.84. Уверенность составляет всего 0.596, поскольку на technical по-прежнему приходится 0.159.

В документации предлагаются 3 сценария. Действуйте при высокой уверенности. Проверяйте результаты со средней уверенностью. Передавайте результаты с низкой уверенностью человеку. Пороговые значения должны зависеть от цены ошибочного действия.

Цена, скорость и детали бенчмарка

Jev стоит $42 за миллиард входных токенов. TypeSafe указывает стоимость существующих LLM на уровне от $0.20 до $10 за 1 млн входных токенов. В записанной демонстрации Jev завершил задачу за 0.114 с при стоимости $0.000081. GPT-5.6 Terra потребовалось 8.566 с при стоимости $0.013880.

Команда TypeSafe утверждает, что Jev в 193.6 раза быстрее и в 444.6 раза дешевле. Эти цифры получены в собственных тестах рабочих процессов TypeSafe. Но здесь стоит остановиться и учесть несколько моментов:

  • Эталонный ответ представляет собой среднее значение для GPT-6 Astra и Fable 5.1.
  • Рабочие процессы написаны командой TypeSafe, отвечающей за оценку возможностей.
  • TypeSafe ожидает, что такие преимущества будут проявляться в основном на верхнем пределе реального использования.
  • TypeSafe заявляет, что не может доказать отсутствие субсидирования цены.

«Нулевые галлюцинации» означают, что соответствие схеме гарантировано. Показатель 0% не является эмпирическим. Ответы всё ещё могут быть неверными.

Что разработчики создают с помощью Jev

Проекты сообщества начали появляться уже через несколько дней после запуска. Вот несколько примеров:

  • Безопасность команд: генеральный директор Vercel Гильермо Раух сообщил, что Jev оказался до 18 раз быстрее GPT Luna по показателю p95 и точнее. В его публикации говорится, что проверка fx по-прежнему выполнялась на Luna. Инженер Пранийт Шарма поделился результатами бенчмарка.
  • Сортировка электронной почты: технический директор Bryo AI Никхил Мудхолкар обнаружил, что Gemini немного точнее, но стоит в 10–20 раз дороже.
  • Браузерные агенты: jev-ultrafast от Browser Use выполнил поиск рейсов Google Flights из Цюриха в Лондон за 7,1 секунды (видео).
  • Телефонные агенты: mobile-jev от Droidrun управлял Uber на реальном телефоне Android: 9 действий примерно за 21 секунду (видео). Бронирование завершено не было.
  • Оценка видео: jevmeter оценивает каждое предложение в дебатах примерно за $0.05 (демонстрация в X).
  • Ввод в реальном времени: Typewriter Стива Крауза обновляет 16 оценок по мере ввода текста (попробовать).
  • Игры: Jev завершил первую боевую миссию StarCraft (видео). Он также управляет охранниками в heist-one (видео).
  • Ограничения для агентов: jev-guard оценивает каждый вызов инструмента как запрещённый, требующий подтверждения или разрешённый (видео продолжительностью 78 секунд).
  • Данные и дома: pg-jev добавляет фильтры на естественном языке в Postgres. HA-Jev превращает ответы в сущности Home Assistant.

Интерактивное объяснение

Основные выводы

  • Jev выдаёт типизированные решения с вероятностями, а не строки.
  • 3 примитива (Choice, Score, Noul) можно объединить в 1 запросе.
  • Входные данные стоят $0.042 за 1 млн токенов. Выходные токены бесплатны.
  • TypeSafe заявляет сквозное время ответа от 70 до 500 мс.
  • Основные бенчмарки проводились поставщиком. Тестируйте систему на собственных данных.

Ознакомьтесь с публикацией о запуске, документацией и GitHub TypeSafe. Вся благодарность — исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему 150k+ ML SubReddit и подписаться на нашу рассылку. Стоп! Вы пользуетесь Telegram? теперь к нам можно присоединиться и в Telegram.

Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости