Zespół badawczy przeprowadził kompleksowy benchmark porównujący standardowe wnioskowanie GPU z trybem poufnym na karcie NVIDIA H100 80GB działającej w instancji Intel TDX. Testowano dwa reprezentacyjne modele językowe - Mistral-7B v0.1 i Qwen3-30B-A3B - mierząc czasie do pierwszego tokenu, całkowite opóźnienie żądania, przepustowość generacji tokenów na żądanie oraz globalną przepustowość tokenów pod rosnącą współbieżnością.

Wyniki ujawniają znaczące, ale kontrolowalne koszty wydajności. W eksperymentach ze stałą szybkością żądań tryb poufny zwiększył średni czas do pierwszego tokenu o 21,8 procent dla Mistral-7B i 27,8 procent dla Qwen3-30B-A3B. Globalna przepustowość tokenów spadła odpowiednio o 17,7 i 21,1 procent. W testach współbieżności z zamkniętą pętlą luki w przepustowości wahały się w zakresie 11,5-20,2 procent, choć większy model osiągnął punkt saturacji wcześniej w trybie poufnym.

Badanie ma praktyczne znaczenie dla wdrażania systemów AI obsługujących wrażliwe dane lub chronujących własne modele. Wyniki sugerują, że poufne wnioskowanie GPU może utrzymać użyteczną przepustowość pod obciążeniem, ale planowanie pojemności infrastruktury musi uwzględnić zarówno stały spadek wydajności, jak i wcześniejsze osiągnięcie saturacji obserwowane dla większych modeli.