Prime Intellect запускает Prime Inference: бессерверное и резервированное обслуживание передовых открытых моделей
Prime Intellect запустила Prime Inference — платформу для предоставления передовых моделей с открытым исходным кодом. Она предлагает бессерверные конечные точки и зарезервированные мощности на собственных GPU Prime в нескольких дата-центрах. До публичного запуска платформа внутренне обрабатывала почти триллион токенов в день. Этот трафик формировался за счёт RL-роллаутов, генерации синтетических данных, оценивания и длительно работающих агентов для написания кода.
Что такое Prime Inference?
Prime Inference — это уровень предоставления моделей в открытом стеке обучения Prime Intellect. Компания уже выпускает инструменты для постобучения, такие как prime-rl, верификаторы и песочницы. Сервис предоставления замыкает этот цикл: развёрнутые модели генерируют рабочие трассировки, которые могут возвращаться в процесс обучения. Prime сообщает, что её конечная точка GLM-5.3 входит в число самых быстрых на OpenRouter. Компания также заявляет о почти нулевом уровне ошибок при вызове инструментов и 100%-ной доступности с момента запуска.
- Два режима: бессерверные конечные точки для переменного спроса и зарезервированные мощности для постоянных нагрузок.
- Совместимость с OpenAI: любой OpenAI SDK можно направить на
https://api.pinference.ai/api/v1(документация). - Доступность: автоматическое переключение между дата-центрами направляет трафик к работоспособным развёртываниям.
- Оборудование: сегодня используются NVIDIA Blackwell, а Vera Rubin указана как готовящаяся к запуску.
- Биллинг: единая система оплаты с отслеживанием использования на уровне команд. Цены для отдельных моделей пока не полностью опубликованы в документации.
Как работает стек предоставления моделей
Стек объединяет NVIDIA Dynamo, vLLM, Mooncake и FlashInfer. Он создан совместно с Inferact и NVIDIA, а исправления передаются в основные репозитории проектов.
Целевая рабочая нагрузка — агентская. Типичный ход работы агента добавляет около 6 тыс. токенов к промпту объёмом 140 тыс. токенов. Prime тестирует такую комбинацию с помощью AgentX от SemiAnalysis и искусственно добавленных холодных запросов.
Разделение prefill/decode: операции prefill и decode выполняются на отдельных группах GPU. Dynamo отвечает за маршрутизацию, а vLLM запускает модель в каждой группе. Декодеры получают вычисленные KV через NIXL. Prime сообщает почти о 40%-ном снижении межтокенной задержки p90 в своих тестах.
Маршрутизация с учётом кэша: маршрутизатор Dynamo, учитывающий KV, сопоставляет перекрытие кэшированного префикса с очередью задач. Между ходами сессии остаются на одном и том же декодере. Mooncake добавляет второй уровень KV-кэша в оперативной памяти хоста.
GLM-5.3 на GB200 NVL72: цифры
Целевой показатель интерактивности составлял 100 токенов в секунду на пользователя от начала до конца. При таком пороге соотношение prefill/decode 1:4 обслуживало наибольшее число пользователей. Оно достигло 66 сессий на группу prefill при скорости 101 токен/с на пользователя и 100 выходных токенов/с на GPU.
- Топология prefill DEP8: примерно в 5 раз больше полезной ёмкости кэша префиксов по сравнению с TEP8 на том же оборудовании.
- Меньший бюджет prefill: уменьшение числа токенов за шаг с 8 тыс. до 4 тыс. на GPU сократило медианное время ожидания в очереди с 550 до 110 мс. Медианное время до получения первого токена уменьшилось примерно на 20%.
- Сжатие KV с помощью NVFP4: размер каждой строки MLA-кэша уменьшился с 576 до 352 байт. Число кэшированных токенов на декодер выросло с 1,09 млн до 1,63 млн.
- Нативное разреженное ядро MLA: около 12,0 мкс при 15 токенах запроса против 17,7 мкс в поэтапном режиме и 13,7 мкс для FP8. Prime отмечает, что этот показатель зависит от рабочей нагрузки.
- Компоновка BLHNC KV: число дескрипторов передачи сократилось с 19 559 примерно до 1 940. Среднее время передачи уменьшилось со 146 до 78 мс.
Надёжные вызовы инструментов
Агенты дают сбой, когда вызовы инструментов содержат неправильные имена или некорректные аргументы. Команда Prime Intellect добавила в Dynamo конструктор структурных тегов для формата инструментов GLM. Затем vLLM использует xgrammar, чтобы маскировать токены, нарушающие схему инструмента. Команда также исправила ошибки разбора, включая декодирование < в < внутри кода.
Интерактивное объяснение
Prime Inference и ближайшие конкуренты
| Функция | Prime Inference | Together AI | Fireworks AI | Baseten |
|---|---|---|---|---|
| Бессерверная GLM-5.3 | Да (источник) | Да (источник) | Да (источник) | Да (источник) |
| Цена GLM-5.3, входные / выходные данные за 1 млн токенов | Пока не опубликована в документации | $1.40 / $4.40 (источник) | $1.40 / $4.40 (трекер) | $1.40 / $4.40 (трекер) |
| Выделенные или зарезервированные мощности | Зарезервированные мощности; развёртывания на выделенных ресурсах в один клик — в дорожной карте | Конечные точки Dedicated Model (источник) | Выделенные GPU-развёртывания по запросу (источник) | Выделенные GPU-развёртывания (источник) |
| API, совместимый с OpenAI | Да | Да | Да | Да |
| Пакетный инференс | В дорожной карте | Да (источник) | Здесь не сравнивается | Здесь не сравнивается |
| Раскрытый стек предоставления моделей | Открытый исходный код: Dynamo, vLLM, Mooncake, FlashInfer | Исследовательский стек инференса Together | Стек предоставления Fireworks | Inference Stack Baseten (источник) |
Цены конкурентов проверены 2 октября 2026 года. Данные трекеров взяты из ComputePrices — стороннего сервиса отслеживания цен.
Основные выводы
- Prime Inference запущена и предлагает бессерверное предоставление моделей с открытым исходным кодом, а также зарезервированные мощности.
- GLM-5.3 работает на GB200 NVL72 с использованием Dynamo, vLLM, Mooncake и FlashInfer.
- Соотношение prefill/decode 1:4 обслуживало 66 сессий на группу prefill при скорости 101 токен/с на пользователя.
- KV-кэш NVFP4 увеличил ёмкость с 1,09 млн до 1,63 млн токенов на декодер.
- Пакетный инференс и развёртывания на выделенных ресурсах в один клик — следующие пункты дорожной карты.
Ознакомьтесь с техническими подробностями, документацией и объявлением в X. Все заслуги принадлежат исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту по машинному обучению с аудиторией 150 тыс.+ и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь к нам можно присоединиться и в Telegram.
Хотите сотрудничать с нами в продвижении вашего репозитория GitHub, страницы на Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.