Sakhanda Wire
NVDA $219.74 -2.34% MSFT $481.63 +0.27% GOOGL $344.20 +0.06% META $543.67 -4.45% AMZN $259.45 -0.71%
← Към новините

NVIDIA пусна TensorRT Model Connect в публичен предварителен преглед: от Hugging Face чекпойнт до нативен C++ инференс с две команди

NVIDIA пусна TensorRT Model Connect (TRTMC) в публичен предварителен преглед — проект с отворен код, който приема поддържан Hugging Face или локален checkpoint и осигурява TensorRT инференс от край до край с две команди. Няма междинна стъпка за експортиране към ONNX. Процесът на компилиране създава версиониран артефакт .bundle, който работи чрез нативни C++ API за задачи, така че инференсът може да се изпълнява в C++ услуга, вградено приложение или роботизирана система без PyTorch в пътя на изпълнение. Проектът е лицензиран под Apache-2.0 и се предлага като колекция от референтни реализации, притежавани от отделни моделни семейства, а не като единен универсален конвертор. NVIDIA също така посочва, че целият проект — реализациите на моделите, оптимизацията на производителността, тестовете, интеграциите и документацията — е разработен с помощта на агенти на OpenAI Codex под човешко ръководство и преглед.

Може ли да бъде внедрен?

Да, за оценка и работа по нативна интеграция, при реални условия. Кодът е с отворен код и може да бъде инсталиран. Понастоящем публикуваните release wheels са предназначени само за Linux aarch64, с Python 3.10 или 3.12, glibc 2.39 или по-нова версия и TensorRT 11.1.0.106. Не са публикувани wheels за x86_64; потребителите на x86_64 трябва да използват пътя за компилиране от изходния код чрез Docker.

  • Ниво на компанията: Най-подходящи днес са екипите, които вече притежават своя стек за инференс: стартъпи, работещи с NVIDIA, компании за роботика и устройства, както и платформени екипи или екипи за инференс в средни и големи предприятия. Малките екипи, които разработват Python услуга, ще извлекат по-малка полза от него. Регулираните предприятия трябва да изчакат маркирана версия, преди да го приемат като стандарт.
  • Индустрии: Роботика и автономни машини, индустриална инспекция и производство, автомобилни изчислителни системи в превозни средства, медицински устройства, периферни системи за отбраната и космическата индустрия, както и медийна обработка — навсякъде, където инференсът трябва да се изпълнява в C++ двоичен файл, а не в Python сървър.
  • Приложения: Генериране на текст на устройството, разпознаване и синтез на реч, OCR и анализ на документи, embeddings и reranking за услуга за извличане, написана на C++, генериране на изображения и видео чрез дифузионни модели, сегментация и прогнозиране на времеви редове.

Двете команди

Бързото начало компилира и изпълнява Qwen3-0.6B:

trtmc build Qwen/Qwen3-0.6B --precision bf16 --max-cache-length 16384 --output qwen3-0.6b.bundle
trtmc run ./qwen3-0.6b.bundle --prompt "What is the capital of France? Answer in one word." --chat-template --no-thinking

Същият .bundle се зарежда от C++ чрез trtmc::load("./qwen3-0.6b.bundle").

Bundle е същинското проектно решение

TRTMC разделя процеса на компилиране и изпълнението чрез версиониран артефакт. Python отговаря за намирането на checkpoint и създаването на TensorRT engine. След това нативните профили изпълняват инференса на C++, без PyTorch. Малък брой хибридни профили извикват помощен Python изпълним файл, като манифестите им изрично декларират тази зависимост.

Приложенията извикват API за задачи — generate(), transcribe(), generate_image(), embed(), solve() — вместо да поддържат етапи за конвертиране и специфичен за всеки модел код за интеграция. trtmc inspect показва вида на bundle, моделното семейство, точността, идентичността на runtime средата и engine-ите, което прави артефакта одитируем, а не непрозрачен.

NVIDIA представя конвенционалния подход като PyTorch → ONNX или TorchScript → TensorRT → специфична за модела C++ интеграция и посочва проблемите, които той отстранява: пропуски при експортирането, повтаряща се интеграция за всеки модел и валидация, разпределена между няколко артефакта за конвертиране.

Основни изводи

  • Две команди превръщат поддържан Hugging Face checkpoint в нативен C++ TensorRT инференс, без стъпка с ONNX.
  • Версионираният .bundle е връзката между Python компилацията и C++ runtime средата без PyTorch.
  • Снимката от 29 юли 2026 г. за GB300 обхваща 105 профила в 76 семейства; 102 надминават обявения си референтен резултат с повече от 5%.
  • Понастоящем wheels са само за Linux aarch64; за x86_64 е необходимо компилиране от изходния код чрез Docker.

Разгледайте GitHub хранилището. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit с над 150 хил. членове за машинно обучение и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.

Имате нужда от партньорство с нас за популяризиране на вашето GitHub хранилище ИЛИ Hugging Face страница ИЛИ продуктово представяне ИЛИ уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини