Sakhanda Wire
NVDA $219.74 -2.34% MSFT $481.63 +0.27% GOOGL $344.20 +0.06% META $543.67 -4.45% AMZN $259.45 -0.71%
← К новостям

NVIDIA выпустила TensorRT Model Connect в публичной предварительной версии: от чекпойнта Hugging Face до нативного инференса на C++ двумя командами

NVIDIA выпустила TensorRT Model Connect (TRTMC) в режиме публичного предварительного просмотра — проект с открытым исходным кодом, который преобразует поддерживаемый чекпойнт Hugging Face или локальный чекпойнт в готовый к сквозному выводу TensorRT результат с помощью двух команд. Промежуточный этап экспорта в ONNX отсутствует. В результате сборки создаётся версионируемый артефакт .bundle, работающий через нативные API задач на C++, поэтому вывод можно выполнять в сервисе на C++, встроенном приложении или робототехническом стеке без PyTorch в цепочке выполнения. Проект распространяется по лицензии Apache-2.0 и поставляется как набор эталонных реализаций, принадлежащих отдельным семействам моделей, а не как один универсальный конвертер. NVIDIA также заявляет, что весь проект — реализации моделей, настройка производительности, тесты, интеграции и документация — был создан с использованием агентов OpenAI Codex под руководством и контролем людей.

Можно ли его развернуть?

Да, для оценки и нативной интеграции, но с реальными ограничениями. Код открыт и устанавливается. Выпускаемые в настоящее время колёса предназначены только для Linux aarch64, с Python 3.10 или 3.12, glibc 2.39 или новее и TensorRT 11.1.0.106. Колёса для x86_64 не публикуются; пользователям x86_64 необходимо использовать путь сборки из исходного кода через Docker.

  • Уровень компании: На сегодняшний день лучше всего проект подходит командам, которые уже владеют своим стеком вывода: стартапам, использующим решения NVIDIA, компаниям в сфере робототехники и устройств, а также платформенным командам и командам вывода в средних и крупных предприятиях. Небольшие команды, создающие сервис на Python, получат от него меньше пользы. Регулируемым предприятиям следует дождаться помеченного релиза, прежде чем стандартизировать его использование.
  • Отрасли: робототехника и автономные машины, промышленный контроль и производство, бортовые вычисления в автомобилях, медицинские устройства, периферийные системы оборонной и аэрокосмической отраслей, а также обработка медиаданных — везде, где вывод должен выполняться внутри бинарного файла на C++, а не на сервере Python.
  • Приложения: генерация текста на устройстве, распознавание и синтез речи, OCR и разбор документов, создание эмбеддингов и переранжирование для сервиса поиска, написанного на C++, генерация изображений и видео с помощью диффузионных моделей, сегментация и прогнозирование временных рядов.

Две команды

В кратком руководстве выполняется сборка и запуск Qwen3-0.6B:

trtmc build Qwen/Qwen3-0.6B --precision bf16 --max-cache-length 16384 --output qwen3-0.6b.bundle
trtmc run ./qwen3-0.6b.bundle --prompt "What is the capital of France? Answer in one word." --chat-template --no-thinking

Тот же файл .bundle загружается из C++ с помощью trtmc::load("./qwen3-0.6b.bundle").

Пакет — это ключевое проектное решение

TRTMC разделяет сборку и выполнение на уровне версионируемого артефакта. Python отвечает за поиск чекпойнта и создание движка TensorRT. Затем нативные профили выполняют вывод на C++ без PyTorch. Небольшое число гибридных профилей вызывает вспомогательный исполняемый файл Python, и их манифесты явно объявляют эту зависимость.

Приложения вызывают API задач — generate(), transcribe(), generate_image(), embed(), solve() — вместо поддержки этапов конвертации и связующего кода для каждого отдельного приложения и модели. Команда trtmc inspect отображает тип пакета, семейство модели, точность, идентификатор среды выполнения и движки, благодаря чему артефакт становится проверяемым, а не непрозрачным.

NVIDIA описывает традиционный путь как PyTorch → ONNX или TorchScript → TensorRT → специфичная для модели интеграция на C++ и называет устраняемые им проблемные места: пробелы при экспорте, повторную интеграцию для каждой модели и проверку, распределённую между несколькими артефактами конвертации.

Ключевые выводы

  • Две команды преобразуют поддерживаемый чекпойнт Hugging Face в нативный вывод TensorRT на C++, без этапа ONNX.
  • Версионируемый файл .bundle служит связующим звеном между сборкой на Python и средой выполнения на C++, не зависящей от PyTorch.
  • Снимок GB300 от 29 июля 2026 года охватывает 105 профилей в 76 семействах; 102 из них превзошли заявленный эталон более чем на 5%.
  • Сегодня колёса доступны только для Linux aarch64; для x86_64 требуется сборка из исходного кода через Docker.

Посмотрите репозиторий на GitHub. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тыс. участников и подписаться на нашу рассылку. Стоп! Вы есть в Telegram? теперь к нам можно присоединиться и в Telegram.

Хотите сотрудничать с нами для продвижения своего репозитория на GitHub, страницы на Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости