Sakhanda Wire
NVDA $233.95 +1.34% MSFT $517.53 +0.92% GOOGL $343.50 +1.56% META $728.08 +0.30% AMZN $251.52 +1.33%
← К новостям

Prime Intellect запускает Prime Inference: бессерверное и резервированное обслуживание передовых открытых моделей

Prime Intellect запустила Prime Inference — платформу для предоставления передовых моделей с открытым исходным кодом. Она предлагает бессерверные конечные точки и зарезервированные мощности на собственных GPU Prime в нескольких дата-центрах. До публичного запуска платформа внутренне обрабатывала почти триллион токенов в день. Этот трафик формировался за счёт RL-роллаутов, генерации синтетических данных, оценивания и длительно работающих агентов для написания кода.

Что такое Prime Inference?

Prime Inference — это уровень предоставления моделей в открытом стеке обучения Prime Intellect. Компания уже выпускает инструменты для постобучения, такие как prime-rl, верификаторы и песочницы. Сервис предоставления замыкает этот цикл: развёрнутые модели генерируют рабочие трассировки, которые могут возвращаться в процесс обучения. Prime сообщает, что её конечная точка GLM-5.3 входит в число самых быстрых на OpenRouter. Компания также заявляет о почти нулевом уровне ошибок при вызове инструментов и 100%-ной доступности с момента запуска.

  • Два режима: бессерверные конечные точки для переменного спроса и зарезервированные мощности для постоянных нагрузок.
  • Совместимость с OpenAI: любой OpenAI SDK можно направить на https://api.pinference.ai/api/v1 (документация).
  • Доступность: автоматическое переключение между дата-центрами направляет трафик к работоспособным развёртываниям.
  • Оборудование: сегодня используются NVIDIA Blackwell, а Vera Rubin указана как готовящаяся к запуску.
  • Биллинг: единая система оплаты с отслеживанием использования на уровне команд. Цены для отдельных моделей пока не полностью опубликованы в документации.

Как работает стек предоставления моделей

Стек объединяет NVIDIA Dynamo, vLLM, Mooncake и FlashInfer. Он создан совместно с Inferact и NVIDIA, а исправления передаются в основные репозитории проектов.

Целевая рабочая нагрузка — агентская. Типичный ход работы агента добавляет около 6 тыс. токенов к промпту объёмом 140 тыс. токенов. Prime тестирует такую комбинацию с помощью AgentX от SemiAnalysis и искусственно добавленных холодных запросов.

Разделение prefill/decode: операции prefill и decode выполняются на отдельных группах GPU. Dynamo отвечает за маршрутизацию, а vLLM запускает модель в каждой группе. Декодеры получают вычисленные KV через NIXL. Prime сообщает почти о 40%-ном снижении межтокенной задержки p90 в своих тестах.

Маршрутизация с учётом кэша: маршрутизатор Dynamo, учитывающий KV, сопоставляет перекрытие кэшированного префикса с очередью задач. Между ходами сессии остаются на одном и том же декодере. Mooncake добавляет второй уровень KV-кэша в оперативной памяти хоста.

GLM-5.3 на GB200 NVL72: цифры

Целевой показатель интерактивности составлял 100 токенов в секунду на пользователя от начала до конца. При таком пороге соотношение prefill/decode 1:4 обслуживало наибольшее число пользователей. Оно достигло 66 сессий на группу prefill при скорости 101 токен/с на пользователя и 100 выходных токенов/с на GPU.

  • Топология prefill DEP8: примерно в 5 раз больше полезной ёмкости кэша префиксов по сравнению с TEP8 на том же оборудовании.
  • Меньший бюджет prefill: уменьшение числа токенов за шаг с 8 тыс. до 4 тыс. на GPU сократило медианное время ожидания в очереди с 550 до 110 мс. Медианное время до получения первого токена уменьшилось примерно на 20%.
  • Сжатие KV с помощью NVFP4: размер каждой строки MLA-кэша уменьшился с 576 до 352 байт. Число кэшированных токенов на декодер выросло с 1,09 млн до 1,63 млн.
  • Нативное разреженное ядро MLA: около 12,0 мкс при 15 токенах запроса против 17,7 мкс в поэтапном режиме и 13,7 мкс для FP8. Prime отмечает, что этот показатель зависит от рабочей нагрузки.
  • Компоновка BLHNC KV: число дескрипторов передачи сократилось с 19 559 примерно до 1 940. Среднее время передачи уменьшилось со 146 до 78 мс.

Надёжные вызовы инструментов

Агенты дают сбой, когда вызовы инструментов содержат неправильные имена или некорректные аргументы. Команда Prime Intellect добавила в Dynamo конструктор структурных тегов для формата инструментов GLM. Затем vLLM использует xgrammar, чтобы маскировать токены, нарушающие схему инструмента. Команда также исправила ошибки разбора, включая декодирование &lt; в < внутри кода.

Интерактивное объяснение

Prime Inference и ближайшие конкуренты

ФункцияPrime InferenceTogether AIFireworks AIBaseten
Бессерверная GLM-5.3Да (источник)Да (источник)Да (источник)Да (источник)
Цена GLM-5.3, входные / выходные данные за 1 млн токеновПока не опубликована в документации$1.40 / $4.40 (источник)$1.40 / $4.40 (трекер)$1.40 / $4.40 (трекер)
Выделенные или зарезервированные мощностиЗарезервированные мощности; развёртывания на выделенных ресурсах в один клик — в дорожной картеКонечные точки Dedicated Model (источник)Выделенные GPU-развёртывания по запросу (источник)Выделенные GPU-развёртывания (источник)
API, совместимый с OpenAIДаДаДаДа
Пакетный инференсВ дорожной картеДа (источник)Здесь не сравниваетсяЗдесь не сравнивается
Раскрытый стек предоставления моделейОткрытый исходный код: Dynamo, vLLM, Mooncake, FlashInferИсследовательский стек инференса TogetherСтек предоставления FireworksInference Stack Baseten (источник)

Цены конкурентов проверены 2 октября 2026 года. Данные трекеров взяты из ComputePrices — стороннего сервиса отслеживания цен.

Основные выводы

  • Prime Inference запущена и предлагает бессерверное предоставление моделей с открытым исходным кодом, а также зарезервированные мощности.
  • GLM-5.3 работает на GB200 NVL72 с использованием Dynamo, vLLM, Mooncake и FlashInfer.
  • Соотношение prefill/decode 1:4 обслуживало 66 сессий на группу prefill при скорости 101 токен/с на пользователя.
  • KV-кэш NVFP4 увеличил ёмкость с 1,09 млн до 1,63 млн токенов на декодер.
  • Пакетный инференс и развёртывания на выделенных ресурсах в один клик — следующие пункты дорожной карты.

Ознакомьтесь с техническими подробностями, документацией и объявлением в X. Все заслуги принадлежат исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту по машинному обучению с аудиторией 150 тыс.+ и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь к нам можно присоединиться и в Telegram.

Хотите сотрудничать с нами в продвижении вашего репозитория GitHub, страницы на Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости