NVIDIA ogłosiła pełną produkcję systemu Vera Rubin z chipem Groq 3 LPX, osiągając nowe rekordy w generowaniu tokenów dla systemów agentycznych. W benchmarku Artificial Analysis na modelu Gemma 4 31B platforma dostarczała 3400 tokenów wyjściowych na sekundę w scenariuszach z kontekstem 100 tys. tokenów - czterokrotnie szybciej niż najbliższe alternatywy na rynku.

To rozwiązanie pojawia się w momencie, gdy branża AI przechodzi z fazy treningowania modeli na fazę wnioskowania i autonomicznych agentów. Agenty te generują znacznie więcej tokenów, przetwarzają dramatycznie większe okna kontekstu i coraz częściej współpracują z innymi systemami AI do rozwiązywania złożonych problemów. Vera Rubin zmienia podejście do optymalizacji infrastruktury - zamiast skupiać się wyłącznie na wydajności, nacisk pada na przepustowość, responsywność i opłacalność w bez precedensu skali.

Partnerstwo przemysłowe szybko się rozwijają. SpaceX AI ogłosił, że procesory NVIDIA Vera będą zasilać jego nową generację agentycznych systemów AI. CoreWeave wdrożył w produkcji Spectrum-X Multiplane, łączący regały Vera Rubin wieloma równoległymi przełącznikami w celu zapewnienia sieci o wysokiej przepustowości bez strat. Nebius został pierwszą chmurą AI, która przyjęła Groq 3 LPX, pokazując rosnące zainteresowanie rozwiązaniami dedykowanymi dla agentów.