Prime Intellect oficjalnie uruchomił Prime Inference jako warstwę serwującą dla swoich modeli open-source, zamykając lukę między treningiem a wdrażaniem. Platforma udostępnia dwa tryby obsługi: serverless endpoints dla zmiennego zapotrzebowania oraz rezerwowaną pojemność dla długotrwałych obciążeń. Endpoint GLM-5.3 zajmuje jedno z najszybszych miejsc w rankingu OpenRouter, a system pochwalił się wskaźnikiem błędów tool-call bliskim zeru i stuprocentowym uptime od startu.
Infrastruktura Prime Inference zbudowana jest na solidnym stosie technologicznym, łączącym NVIDIA Dynamo, vLLM, Mooncake i FlashInfer. System automatycznie przełącza ruch między datacenterami w razie awarii, zapewniając ciągłość usługi. Hardware bazuje obecnie na GPU NVIDIA Blackwell, a firma planuje dodać wsparcie dla Vera Rubin. Przed publicznym debiutem platforma przetwarzała niemal bilion tokenów dziennie, obsługując RL rollouts, generowanie syntetycznych danych treningowych i długotrwale działające agenty kodowe.
Rozwiązanie jest kompatybilne z SDK OpenAI - wystarczy zmienić endpoint na api.pinference.ai. Prime Inference stanowi naturalną część całego stosu open-source Prime Intellect, który już obejmuje narzędzia post-treningowe i weryfikatory. Unified billing z trackingiem na poziomie zespołu ułatwia zarządzanie kosztami, choć szczegółowy cennik per-model nie jest jeszcze w pełni opublikowany.