NVIDIA випустила TensorRT Model Connect у публічній попередній версії: від чекпойнта Hugging Face до нативного C++-інференсу двома командами
NVIDIA випустила TensorRT Model Connect (TRTMC) у форматі публічної попередньої версії — проєкт із відкритим кодом, який бере підтримувану модель Hugging Face або локальний чекпойнт і забезпечує наскрізний TensorRT-інференс за допомогою двох команд. Проміжний експорт в ONNX не потрібен. У результаті збірки створюється версіонований артефакт .bundle, який працює через нативні C++ API для виконання завдань, тож інференс може виконуватися в сервісі на C++, інтегрованому застосунку або робототехнічному стеку без PyTorch у середовищі виконання. Проєкт ліцензовано за Apache-2.0 і він постачається як набір еталонних реалізацій для окремих сімейств моделей, а не як один універсальний конвертер. NVIDIA також зазначає, що весь проєкт — реалізації моделей, оптимізація продуктивності, тести, інтеграції та документація — було створено за допомогою агентів OpenAI Codex під керівництвом і наглядом людей.
Чи придатний він до розгортання?
Так, для оцінювання та нативної інтеграції, але з реальними обмеженнями. Код відкритий і доступний для встановлення. Наразі готові wheels-релізи призначені лише для Linux aarch64, із Python 3.10 або 3.12, glibc 2.39 або новішої версії та TensorRT 11.1.0.106. Wheels для x86_64 не публікуються; користувачі x86_64 мають скористатися шляхом збірки з вихідного коду у Docker.
- Рівень компанії: Сьогодні найкраще рішення підходить командам, які вже мають власний стек інференсу: стартапам, що працюють з NVIDIA, компаніям у галузях робототехніки та пристроїв, а також платформним командам або командам інференсу в середніх і великих підприємствах. Невеликі команди, які розгортають сервіс на Python, отримають від нього менше користі. Регульованим підприємствам варто дочекатися тегованого релізу, перш ніж стандартизувати його використання.
- Галузі: Робототехніка й автономні машини, промисловий контроль та виробництво, автомобільні обчислення безпосередньо в транспортному засобі, медичні пристрої, периферійні системи для оборони й аерокосмічної галузі, а також обробка медіа — всюди, де інференс має працювати всередині бінарного файлу C++, а не на сервері Python.
- Застосування: Генерація тексту на пристрої, розпізнавання та синтез мовлення, OCR і аналіз документів, ембеддинги та повторне ранжування для сервісу пошуку, написаного на C++, генерація зображень і відео методом дифузії, сегментація та прогнозування часових рядів.
Дві команди
Швидкий старт створює та запускає Qwen3-0.6B:
trtmc build Qwen/Qwen3-0.6B --precision bf16 --max-cache-length 16384 --output qwen3-0.6b.bundle
trtmc run ./qwen3-0.6b.bundle --prompt "What is the capital of France? Answer in one word." --chat-template --no-thinking
Цей самий .bundle завантажується з C++ за допомогою trtmc::load("./qwen3-0.6b.bundle").
Bundle — це ключове архітектурне рішення
TRTMC розділяє етапи збірки та виконання за допомогою версіонованого артефакту. Python відповідає за пошук чекпойнта та створення рушія TensorRT. Потім нативні профілі виконують інференс у C++ без PyTorch. Невелика кількість гібридних профілів викликає допоміжний виконуваний файл Python, і їхні маніфести явно вказують на цю залежність.
Застосунки викликають API завдань — generate(), transcribe(), generate_image(), embed(), solve() — замість підтримки етапів конвертації та специфічної для кожної моделі інтеграції застосунку. Команда trtmc inspect показує тип bundle, сімейство моделі, точність, ідентифікатор середовища виконання та рушії, завдяки чому артефакт можна перевіряти, а не сприймати як непрозорий.
NVIDIA описує традиційний підхід як PyTorch → ONNX або TorchScript → TensorRT → специфічна для моделі інтеграція з C++ і називає проблеми, яких він дає змогу уникнути: прогалини під час експорту, повторну інтеграцію для кожної моделі та перевірку, розподілену між кількома артефактами конвертації.
Ключові висновки
- Дві команди перетворюють підтримуваний чекпойнт Hugging Face на нативний TensorRT-інференс у C++ без етапу ONNX.
- Версіонований
.bundleє точкою передачі між збіркою на Python і середовищем виконання на C++ без PyTorch. - Знімок GB300 від 29 липня 2026 року охоплює 105 профілів у 76 сімействах; 102 з них перевершують заявлений еталон більш ніж на 5%.
- Наразі wheels доступні лише для Linux aarch64; для x86_64 потрібна збірка з вихідного коду в Docker.
Перегляньте репозиторій на GitHub. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабредіту про машинне навчання з понад 150 тисячами учасників та підписатися на нашу розсилку. Зачекайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.
Потрібна партнерська співпраця з нами для просування вашого репозиторію на GitHub, сторінки на Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.