Sakhanda Wire
NVDA $219.74 -2.34% MSFT $481.63 +0.27% GOOGL $344.20 +0.06% META $543.67 -4.45% AMZN $259.45 -0.71%
← До новин

NVIDIA випустила TensorRT Model Connect у публічній попередній версії: від чекпойнта Hugging Face до нативного C++-інференсу двома командами

NVIDIA випустила TensorRT Model Connect (TRTMC) у форматі публічної попередньої версії — проєкт із відкритим кодом, який бере підтримувану модель Hugging Face або локальний чекпойнт і забезпечує наскрізний TensorRT-інференс за допомогою двох команд. Проміжний експорт в ONNX не потрібен. У результаті збірки створюється версіонований артефакт .bundle, який працює через нативні C++ API для виконання завдань, тож інференс може виконуватися в сервісі на C++, інтегрованому застосунку або робототехнічному стеку без PyTorch у середовищі виконання. Проєкт ліцензовано за Apache-2.0 і він постачається як набір еталонних реалізацій для окремих сімейств моделей, а не як один універсальний конвертер. NVIDIA також зазначає, що весь проєкт — реалізації моделей, оптимізація продуктивності, тести, інтеграції та документація — було створено за допомогою агентів OpenAI Codex під керівництвом і наглядом людей.

Чи придатний він до розгортання?

Так, для оцінювання та нативної інтеграції, але з реальними обмеженнями. Код відкритий і доступний для встановлення. Наразі готові wheels-релізи призначені лише для Linux aarch64, із Python 3.10 або 3.12, glibc 2.39 або новішої версії та TensorRT 11.1.0.106. Wheels для x86_64 не публікуються; користувачі x86_64 мають скористатися шляхом збірки з вихідного коду у Docker.

  • Рівень компанії: Сьогодні найкраще рішення підходить командам, які вже мають власний стек інференсу: стартапам, що працюють з NVIDIA, компаніям у галузях робототехніки та пристроїв, а також платформним командам або командам інференсу в середніх і великих підприємствах. Невеликі команди, які розгортають сервіс на Python, отримають від нього менше користі. Регульованим підприємствам варто дочекатися тегованого релізу, перш ніж стандартизувати його використання.
  • Галузі: Робототехніка й автономні машини, промисловий контроль та виробництво, автомобільні обчислення безпосередньо в транспортному засобі, медичні пристрої, периферійні системи для оборони й аерокосмічної галузі, а також обробка медіа — всюди, де інференс має працювати всередині бінарного файлу C++, а не на сервері Python.
  • Застосування: Генерація тексту на пристрої, розпізнавання та синтез мовлення, OCR і аналіз документів, ембеддинги та повторне ранжування для сервісу пошуку, написаного на C++, генерація зображень і відео методом дифузії, сегментація та прогнозування часових рядів.

Дві команди

Швидкий старт створює та запускає Qwen3-0.6B:

trtmc build Qwen/Qwen3-0.6B --precision bf16 --max-cache-length 16384 --output qwen3-0.6b.bundle
trtmc run ./qwen3-0.6b.bundle --prompt "What is the capital of France? Answer in one word." --chat-template --no-thinking

Цей самий .bundle завантажується з C++ за допомогою trtmc::load("./qwen3-0.6b.bundle").

Bundle — це ключове архітектурне рішення

TRTMC розділяє етапи збірки та виконання за допомогою версіонованого артефакту. Python відповідає за пошук чекпойнта та створення рушія TensorRT. Потім нативні профілі виконують інференс у C++ без PyTorch. Невелика кількість гібридних профілів викликає допоміжний виконуваний файл Python, і їхні маніфести явно вказують на цю залежність.

Застосунки викликають API завдань — generate(), transcribe(), generate_image(), embed(), solve() — замість підтримки етапів конвертації та специфічної для кожної моделі інтеграції застосунку. Команда trtmc inspect показує тип bundle, сімейство моделі, точність, ідентифікатор середовища виконання та рушії, завдяки чому артефакт можна перевіряти, а не сприймати як непрозорий.

NVIDIA описує традиційний підхід як PyTorch → ONNX або TorchScript → TensorRT → специфічна для моделі інтеграція з C++ і називає проблеми, яких він дає змогу уникнути: прогалини під час експорту, повторну інтеграцію для кожної моделі та перевірку, розподілену між кількома артефактами конвертації.

Ключові висновки

  • Дві команди перетворюють підтримуваний чекпойнт Hugging Face на нативний TensorRT-інференс у C++ без етапу ONNX.
  • Версіонований .bundle є точкою передачі між збіркою на Python і середовищем виконання на C++ без PyTorch.
  • Знімок GB300 від 29 липня 2026 року охоплює 105 профілів у 76 сімействах; 102 з них перевершують заявлений еталон більш ніж на 5%.
  • Наразі wheels доступні лише для Linux aarch64; для x86_64 потрібна збірка з вихідного коду в Docker.

Перегляньте репозиторій на GitHub. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабредіту про машинне навчання з понад 150 тисячами учасників та підписатися на нашу розсилку. Зачекайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.

Потрібна партнерська співпраця з нами для просування вашого репозиторію на GitHub, сторінки на Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини