NVIDIA przedstawiła dane wydajnościowe układów Vera Rubin NVL72, wykazując do 30 razy wyższą przepustowość na megawat w porównaniu z poprzedzającą generacją GB300 NVL72 na obciążeniach agentic AI. Pomiary przeprowadzono z użyciem workloadu SemiAnalysis AgentX, opartego na rzeczywistych sesjach kodowania agentów AI z zachowanym naturalnym wzrostem kontekstu, wywołaniami narzędzi i generowaniem pośrednich agentów.
Agenty AI stanowią nową klase aplikacji wymagającą zdecydowanie więcej zasobów niż tradycyjne czaty. Według danych OpenRouteru agenty AI generują 15 razy więcej tokenów niż prosta konwersacja, bo wykonują sekwencje złożonych działań - wyszukują w bazach danych, czytają artykuły, uruchamiają pośrednie analizy, a każdy krok staje się wejściem dla następnego. Agent badający firmę do decyzji inwestycyjnej musi zainterrogować finansowe bazy danych, przeszukać wiadomości i dokumenty, wywołać sub-agenta do porównań branżowych i modelowania wyceny, a następnie zsyntezować wszystkie informacje w rekomendację.
Za tym dramatycznym skokiem wydajności kryje się zarówno sprzęt jak i oprogramowanie. Vera Rubin NVL72 to nowa generacja infrastruktury obliczeniowej zaprojektowana specjalnie dla długocontextowych obciążeń, które są nieodłączne od agentów AI. W miarę jak agenty przechodzą do produkcji w różnych branżach - od development oprogramowania przez obsługę klienta do głębokich badań - operatorzy datacentrów potrzebują infrastruktury zdolnej efektywnie obsługiwać rosnący popyt na tokeny. Dla power-constrained AI factories te wyniki oznaczają możliwość wykonania 30 razy więcej pracy agencyjnej przy tym samym zużyciu energii - przełomowe dla rentowności i skalowalności nowych modeli biznesowych opartych na AI.