Prime Intellect стартира Prime Inference: безсървърно и резервирано обслужване за водещи отворени модели
Prime Intellect стартира Prime Inference — платформа за обслужване на авангардни модели с отворен код. Тя предлага безсървърни крайни точки и резервиран капацитет върху собствените GPU на Prime в множество центрове за данни. Преди публичното си представяне платформата обработваше вътрешно близо един трилион токена дневно. Този трафик идваше от RL развъртания, генериране на синтетични данни, оценки и дълго работещи агенти за програмиране.
Какво представлява Prime Inference?
Prime Inference е слоят за обслужване на отворения стек за обучение на Prime Intellect. Компанията вече предлага инструменти за дообучение като prime-rl, верификатори и пясъчници. Обслужването затваря този цикъл: внедрените модели генерират производствени трасета, които могат да се върнат обратно в обучението. Prime съобщава, че нейната GLM-5.3 крайна точка е сред най-бързите в OpenRouter. Компанията също така посочва почти нулев процент грешки при извикване на инструменти и 100% непрекъсваемост от стартирането.
- Два режима: безсървърни крайни точки за променливо търсене и резервиран капацитет за устойчиви натоварвания.
- Съвместимост с OpenAI: насочете всеки OpenAI SDK към
https://api.pinference.ai/api/v1(документация). - Непрекъсваемост: автоматичното превключване между центрове за данни насочва трафика към работещи внедрявания.
- Хардуер: NVIDIA Blackwell днес, като Vera Rubin е посочен като предстоящ.
- Таксуване: унифицирано таксуване с проследяване на използването на ниво екип. Ценообразуването за отделните модели все още не е напълно публикувано в документацията.
Как работи стекът за обслужване
Стекът комбинира NVIDIA Dynamo, vLLM, Mooncake и FlashInfer. Той е изграден с Inferact и NVIDIA, а корекциите се допринасят към upstream проекта.
Целевото натоварване е агентно. Един типичен ход на агента добавя около 6K токена към подкана от 140K токена. Prime сравнява този тип натоварване със AgentX на SemiAnalysis и с инжектирани студени пристигания.
Дезагрегация на prefill/decode: Prefill и decode се изпълняват в отделни групи GPU. Dynamo управлява маршрутизирането, а vLLM изпълнява модела във всяка група. Декодерите извличат изчисления KV чрез NIXL. Prime отчита близо 40% по-ниска p90 латентност между токените в своите тестове.
Маршрутизиране с отчитане на кеша: KV-ориентираният маршрутизатор на Dynamo претегля припокриването на кеширания префикс спрямо работата на опашката. Сесиите остават на същия декодер между отделните ходове. Mooncake добавя второ KV ниво в хост DRAM.
GLM-5.3 върху GB200 NVL72: числата
Целта за интерактивност беше 100 токена в секунда от край до край за потребител. При този праг съотношение prefill/decode 1:4 обслужваше най-много потребители. То достигна 66 сесии на prefill група при 101 токена/секунда на потребител и 100 изходни токена/секунда на GPU.
- Топология на DEP8 prefill: приблизително 5 пъти повече използваем капацитет на кеша на префикса от TEP8 върху същия хардуер.
- По-малък prefill бюджет: намаляването наполовина на токените на стъпка — от 8K на 4K на GPU — съкрати медианното чакане на опашката от 550 ms на 110 ms. Медианното време до първия токен спадна с около 20%.
- NVFP4 компресия на KV: всеки MLA кеш ред се сви от 576 на 352 байта. Кешираните токени на декодер се увеличиха от 1,09M на 1,63M.
- Нативно разредено-MLA ядро: около 12,0 μs при 15 токена на заявка спрямо 17,7 μs при поетапно изпълнение и 13,7 μs при FP8. Prime отбелязва, че това зависи от конкретното натоварване.
- BLHNC KV оформление: дескрипторите за трансфер намаляха от 19 559 до около 1 940. Средното време за трансфер спадна от 146 ms на 78 ms.
Надеждни извиквания на инструменти
Агентите се провалят, когато извикванията на инструменти съдържат неправилни имена или повредени аргументи. Екипът на Prime Intellect допринесе за Dynamo конструктор на структурни тагове за формата на инструментите на GLM. След това vLLM използва xgrammar, за да маскира токените, които нарушават схемата на инструмента. Екипът също така коригира грешки при парсването, включително декодирането на < до < в кода.
Интерактивно обяснение
Prime Inference спрямо най-близките конкуренти
| Функция | Prime Inference | Together AI | Fireworks AI | Baseten |
|---|---|---|---|---|
| Безсървърен GLM-5.3 | Да (източник) | Да (източник) | Да (източник) | Да (източник) |
| Цена на GLM-5.3, вход / изход на 1M токена | Все още не е публикувана в документацията | $1.40 / $4.40 (източник) | $1.40 / $4.40 (тракер) | $1.40 / $4.40 (тракер) |
| Специализиран или резервиран капацитет | Резервиран капацитет; специализирани внедрявания с едно кликване са в пътната карта | Крайни точки Dedicated Model (източник) | Специализирани GPU внедрявания при поискване (източник) | Специализирани GPU внедрявания (източник) |
| API, съвместим с OpenAI | Да | Да | Да | Да |
| Пакетно извеждане | В пътната карта | Да (източник) | Не е сравнявано тук | Не е сравнявано тук |
| Разкрит стек за обслужване | Отворен код: Dynamo, vLLM, Mooncake, FlashInfer | Изследователски стек за извеждане на Together | Стек за обслужване на Fireworks | Baseten Inference Stack (източник) |
Цените на конкурентите са проверени на 2 октомври 2026 г. Данните от тракера са предоставени от ComputePrices, независим тракер на цените.
Основни изводи
- Prime Inference е активна с безсървърно и резервирано обслужване за модели с отворен код.
- GLM-5.3 работи върху GB200 NVL72 с Dynamo, vLLM, Mooncake и FlashInfer.
- Съотношението 1:4 prefill/decode обслужваше 66 сесии на prefill група при 101 токена/секунда на потребител.
- NVFP4 KV кешът увеличи капацитета от 1,09M на 1,63M токена на декодер.
- Пакетното извеждане и специализираните внедрявания с едно кликване са следващите елементи в пътната карта.
Разгледайте техническите подробности, документацията и съобщението в X. Всички заслуги са за изследователя на този проект. Също така не се колебайте да ни последвате в Twitter и не забравяйте да се присъедините към нашия 150k+ ML SubReddit и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? вече можете да се присъедините към нас и в Telegram.
Имате нужда от партньорство с нас за популяризиране на вашето GitHub хранилище ИЛИ Hugging Face страница ИЛИ продуктово представяне ИЛИ уебинар и т.н.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.