Nunchux AI udostępnił VC-Attention, training-free kernel z nisko-bitową precyzją przeznaczony dla video Diffusion Transformers. Rozwiązanie jednocześnie rozwiązuje dwa problemy: błędy kwantyzacji wartości i powolny etap softmax, które są krytycznym wąskim gardłem w generowaniu wideo.

Mechanizm attention w video DiTs okazuje się być głównym powodem spowolnień, stanowiąc ponad 64 procent czasu generowania na karcie RTX 5090. Dla 5-sekundowego klipu 720p może to oznaczać około 70 tysięcy tokenów przetwarzanych sekwencyjnie w każdej warstwie sieci. Poprzednie metody optymalizacji, takie jak SageAttention2, skupiały się na wygładzaniu zapytań i kluczy, ale to pozostawiało termin wartości odpowiedzialnym za aż 82 procent błędów wyjścia. Dodatkowym problemem był softmax między produktami matrycowymi, który wciąż wykonywał się w pełnej precyzji FP32 nawet na zaawansowanych procesorach typu B200 czy H200.

VC-Attention wprowadza dwie kluczowe innowacje. Po pierwsze, V-Smooth wykorzystuje online k-means clustering do grupowania wartości tokenów per batch i head, następnie zmniejszając błędy poprzez odejmowanie średnich z bloków 128-tokenowych przed kwantyzacją. Po drugie, wykorzystanie low-bit Tensor Cores przyspiesza operacje mnożenia macierzy QK i PV. To podejście jest wolne od treningu, co oznacza, że może być zastosowane do istniejących modeli bez konieczności ich przetrenowywania. Dla branży generacji wideo na dużą skalę oznacza to potencjalne zwielokrotnienie prędkości przetwarzania, szczególnie przy bardzo dużych modelach jak Wan2.2-14B czy MiniMax-H3.