Together AI pomyślnie przeniosło bibliotekę ThunderKittens na nowy akcelerator NVIDIA Vera Rubin NVL72, osiągając wydajność 22 PFLOPS w operacjach mnożenia macierzy (GEMM) przy użyciu formatu NVFP4. To oznacza skok z 42% do znacznie lepszego wykorzystania dostępnej przepustowości teoretycznej karty.
Nowe zadanie wymagało gruntownej przebudowy gotowego zestawu instrukcji (ISA) dla Vera Rubin. Liczba 22 PFLOPS stawia ThunderKittens w jednym szeregu z establiszmentem - są to wyniki konkurencyjne do popularnych bibliotek cuBLAS i frameworku CuTe DSL, które od lat dominują w praktycznych zastosowaniach. Poprzednia implementacja osiągała znacznie mniej użyteczny poziom wydajności, więc ta optymalizacja stanowi konkretny postęp.
To pokazuje istotny trend w obliczeniach AI - wraz z każdą nową generacją sprzętu od NVIDIA, biblioteki i frameworki muszą być dostosowywane do konkretnych cech karty. ThunderKittens pozycjonuje się jako narzędzie dla tych, którzy chcą mieć kontrolę nad szczegółami optymalizacji, zamiast polegać na czarnych skrzynkach. Dla zespołów pracujących nad modelami głębokich sieci neuronowych takie narzędzia mogą przełożyć się na realne oszczędności energii i przyspieszenie treningu.