NVIDIA udostępniła w publicznej wersji zapoznawczej TensorRT Model Connect, otwarte narzędzie upraszczające proces wdrażania modeli sztucznej inteligencji poprzez konwersję checkpointów z Hugging Face do wnioskowania TensorRT za pomocą zaledwie dwóch komend.

Kluczową zaletą rozwiązania jest eliminacja pośredniego etapu eksportu ONNX, co skraca ścieżkę od modelu do produkcji. Narzędzie generuje wersjonowany artefakt .bundle, który wykonuje się za pośrednictwem natywnych API C++. Dzięki temu wnioskowanie może pracować w serwisach C++, aplikacjach wbudowanych oraz systemach robotycznych bez konieczności mienia PyTorch w ścieżce uruchomieniowej. Projekt przyjmuje postać zbioru referencyjnych implementacji specjalistycznych dla poszczególnych rodzin modeli, a nie uniwersalnego konwertera.

Część kodu, w tym implementacje modeli, optymalizacje wydajności, testy, integracje i dokumentacja, powstała przy wsparciu agentów OpenAI Codex pod kontrolą człowieka. Obecne dystrybucje wspierają Linux aarch64 z Python 3.10 lub 3.12 i TensorRT 11.1.0.106, podczas gdy użytkownicy x86-64 muszą skompilować kod ze źródeł w Dockerze. Rozwiązanie będzie szczególnie wartościowe dla zespołów mających własny stos wnioskowania - startupów opartych na rozwiązaniach NVIDIA, firm robotycznych, firm zajmujących się urządzeniami oraz zespołów infrastrukturalnych w dużych przedsiębiorstwach.