AttSVD to nowa technika kompresji KV cache dla transformerów autoregresyjnych, która rozwiązuje problem rosnącej liniowo pamięci wraz z długością kontekstu. Tradycyjne podejścia usuwają tokeny o niskiej ważności z sekwencji, co jest nieodwracalne. AttSVD idzie inną drogą: zatrzymuje każdy token, ale zapisuje go w bardziej efektywny sposób poprzez kompresję w wymiarze cech zamiast w wymiarze sekwencji.

Serca metody stanowi per-prompt truncated SVD oparta na geometrii atencji - dla każdego promptu algorytm oblicza rozkład osobliwe i przechowuje tylko kierunki, które rzeczywiście czyta mechanizm atencji. Podejście to zmniejsza pamięć KV cache na головę proporcjonalnie do zachowanego rzędu macierzy. Autorzy proponują dwie strategie cache'owania w time decode - accumulating dla krótszych generacji i streaming dla długich sekwencji - oraz dwie udoskonalenia czyniące kompresję adaptacyjną. Per-matrix energy rule niezależnie skaluje przestrzeń logitów i masę atencji, a attention-aware basis truncates tylko w przestrzeniach faktycznie czytanych przez atencję, co zachowuje zarówno logity atencji jak i jej wyjście.

Testy na wielu modelach, zarówno na benchmark agentic jak i pełnym zestawie LongBench, pokazują że AttSVD utrzymuje wydajność pełnego cache'a przy jednoczesnym zmniejszeniu zużycia pamięci KV cache do 50 procent oryginalnego poziomu. Bonus stanowi bezpłatna, per-head interpretacyjna informacja o efektywnym rzędzie i geometrii atencji, co pomaga zrozumieć wewnętrzne działanie modelu.