System NVIDIA Vera Rubin NVL72 osiągnął najlepsze wyniki wydajności w swoim pierwszym debiucie w MLPerf Inference v6.1, dostarczając do 3,7 razy lepszą przepustowość niż poprzednia generacja GB300 NVL72. To significante osiągnięcie ukazuje progres NVIDII w optymalizacji infrastruktury dla wnioskowania w dużych modelach.
Wyniki pokazują trzy kluczowe aspekty determinujące ekonomikę AI inference. Po pierwsze, wyższa wydajność systemu przekłada się bezpośrednio na większą liczbę wygenerowanych tokenów i potencjalnie wyższe przychody. Drugi element to efektywne skalowanie - submission GB300 NVL72 obejmujący 288 GPU-ów rozłożonych na cztery rack'i osiągnął 99-procentową efektywność skalowania, gdzie przepustowość rosła prawie liniowo. Trzeci element to ciągła optymalizacja oprogramowania, która w v6.1 dostarczyła wzrost wydajności do 1,6 raza w porównaniu z v6.0.
Platforma NVIDIA jest projektowana wokół koncepcji fungibility - ta sama infrastruktura może uruchamiać dowolne modele i obciążenia, od trenowania po inference, od rekomendacyjnych systemów po reasoning, od języka po wideo. To utrzymuje wysokie wykorzystanie zasobów i pozwala organizacjom maksymalizować zwrot z inwestycji w infrastrukturę AI. Wyniki MLPerf Inference v6.1 demonstrują, że NVIDIA kontynuuje optymalizacje nawet po oficjalnym submission, wskazując na konsekwentne ulepszenia wydajności.