Sakhanda Wire
NVDA $233.95 +1.34% MSFT $517.53 +0.92% GOOGL $343.50 +1.56% META $728.08 +0.30% AMZN $251.52 +1.33%
← До новин

Prime Intellect запускає Prime Inference: безсерверне та резервоване обслуговування передових відкритих моделей

Prime Intellect запустила Prime Inference — платформу обслуговування передових моделей із відкритим кодом. Вона пропонує безсерверні кінцеві точки та зарезервовані потужності на власних GPU Prime у кількох дата-центрах. До публічного запуску платформа внутрішньо обробляла майже трильйон токенів на день. Цей трафік надходив від RL-розгортань, генерації синтетичних даних, оцінювань і довготривалих агентів для програмування.

Що таке Prime Inference?

Prime Inference — це рівень обслуговування відкритого стеку навчання Prime Intellect. Компанія вже постачає інструменти для постнавчання, такі як prime-rl, верифікатори та пісочниці. Обслуговування замикає цей цикл: розгорнуті моделі генерують робочі трасування, які можуть повертатися до процесу навчання. Prime повідомляє, що її кінцева точка GLM-5.3 є однією з найшвидших на OpenRouter. Також компанія заявляє про майже нульовий рівень помилок викликів інструментів і 100% доступність від моменту запуску.

  • Два режими: безсерверні кінцеві точки для змінного попиту, зарезервовані потужності для стабільних робочих навантажень.
  • Сумісність з OpenAI: підключіть будь-який OpenAI SDK до https://api.pinference.ai/api/v1 (документація).
  • Доступність: автоматичне перемикання між дата-центрами спрямовує трафік до працездатних розгортань.
  • Обладнання: наразі NVIDIA Blackwell, а Vera Rubin зазначена як така, що незабаром з’явиться.
  • Оплата: уніфікована система оплати з відстеженням використання на рівні команди. Ціни для окремих моделей ще не повністю опубліковані в документації.

Як працює стек обслуговування

Стек поєднує NVIDIA Dynamo, vLLM, Mooncake і FlashInfer. Його створено спільно з Inferact і NVIDIA, а виправлення передаються до основних репозиторіїв.

Цільове робоче навантаження є агентним. Типовий хід агента додає близько 6K токенів до промпту обсягом 140K токенів. Prime тестує цю комбінацію за допомогою AgentX від SemiAnalysis та змодельованих холодних надходжень.

Розділення prefill/decode: prefill і decode виконуються на окремих групах GPU. Dynamo відповідає за маршрутизацію, а vLLM запускає модель у кожній групі. Декодери отримують обчислений KV через NIXL. Prime повідомляє про майже на 40% нижчу міжтокенову затримку p90 у своїх тестах.

Маршрутизація з урахуванням кешу: маршрутизатор Dynamo, який враховує KV, зважує перекриття кешованого префікса та обсяг роботи в черзі. Між ходами сесії залишаються на тому самому декодері. Mooncake додає другий рівень KV у системній DRAM.

GLM-5.3 на GB200 NVL72: цифри

Цільовим показником інтерактивності було 100 токенів на секунду на користувача від початку до кінця. За такого показника співвідношення prefill/decode 1:4 обслуговувало найбільшу кількість користувачів. Воно досягло 66 сесій на групу prefill за швидкості 101 токен/с на користувача та 100 вихідних токенів/с на GPU.

  • Топологія prefill DEP8: приблизно у 5 разів більша корисна місткість кешу префіксів, ніж у TEP8 на тому самому обладнанні.
  • Менший бюджет prefill: зменшення кількості токенів за крок із 8K до 4K на GPU скоротило медіанний час очікування в черзі з 550 мс до 110 мс. Медіанний час до появи першого токена зменшився приблизно на 20%.
  • Стиснення KV за допомогою NVFP4: кожен рядок кешу MLA зменшився з 576 до 352 байтів. Кількість кешованих токенів на декодер зросла з 1,09 млн до 1,63 млн.
  • Власне розріджене ядро MLA: близько 12,0 мкс за 15 токенів запиту проти 17,7 мкс у поетапному режимі та 13,7 мкс у FP8. Prime зазначає, що це залежить від робочого навантаження.
  • Розкладка KV BLHNC: кількість дескрипторів передавання скоротилася з 19 559 до приблизно 1 940. Середній час передавання зменшився зі 146 мс до 78 мс.

Надійні виклики інструментів

Агенти дають збій, коли виклики інструментів містять неправильні назви або пошкоджені аргументи. Команда Prime Intellect додала до Dynamo конструктор структурних тегів для формату інструментів GLM. Потім vLLM використовує xgrammar, щоб маскувати токени, які порушують схему інструменту. Команда також виправила помилки парсингу, зокрема декодування &lt; у < всередині коду.

Інтерактивне пояснення

Prime Inference у порівнянні з найближчими конкурентами

ФункціяPrime InferenceTogether AIFireworks AIBaseten
Безсерверна GLM-5.3Так (джерело)Так (джерело)Так (джерело)Так (джерело)
Ціна GLM-5.3, вхідні / вихідні токени за 1 млнЩе не опубліковано в документації$1.40 / $4.40 (джерело)$1.40 / $4.40 (трекер)$1.40 / $4.40 (трекер)
Виділені або зарезервовані потужностіЗарезервовані потужності; розгортання виділених ресурсів в один клік — у планахКінцеві точки виділених моделей (джерело)Виділені GPU-розгортання на вимогу (джерело)Виділені GPU-розгортання (джерело)
API, сумісний з OpenAIТакТакТакТак
Пакетний висновокУ планахТак (джерело)Тут не порівнюєтьсяТут не порівнюється
Розкритий стек обслуговуванняВідкритий код: Dynamo, vLLM, Mooncake, FlashInferДослідницький стек інференсу TogetherСтек обслуговування FireworksInference Stack від Baseten (джерело)

Ціни конкурентів перевірено 2 жовтня 2026 року. Дані трекера взято з ComputePrices — стороннього трекера цін.

Основні висновки

  • Prime Inference працює, пропонуючи безсерверне обслуговування та зарезервовані потужності для відкритих моделей.
  • GLM-5.3 працює на GB200 NVL72 із використанням Dynamo, vLLM, Mooncake і FlashInfer.
  • Співвідношення prefill/decode 1:4 обслуговувало 66 сесій на групу prefill за швидкості 101 токен/с на користувача.
  • Кеш KV на базі NVFP4 збільшив місткість із 1,09 млн до 1,63 млн токенів на декодер.
  • Пакетний інференс і розгортання виділених ресурсів в один клік є наступними пунктами дорожньої карти.

Ознайомтеся з технічними деталями, документацією та оголошенням в X. Уся подяка належить досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого субреддіту про машинне навчання з понад 150 тисячами учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.

Потрібна співпраця з нами для просування вашого репозиторію GitHub, сторінки на Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини