Naukowcy zaproponowali fundamentalnie nowy sposób podejścia do problemu rzadkiej atencji w dużych modelach językowych - nie jako wyboru największych wartości z macierzy, ale jako prawdziwego problemu aproksymacji macierzy. Dotychczasowe metody były matematycznie błędne, ponieważ ignorowały, że wpisy macierzy atencji są strukturalnie powiązane i wspólnie determinują wynik poprzez mnożenie z wektorami wartości.

Aktualny problem jest konkretny: standardowa atencja ma koszta kwadratowy względem długości promptu, co ogranicza wydajność LLM-ów. Istniejące podejścia do rzadkiej atencji po prostu zachowują wpisy o dużej masie, traktując problem jak wybór wartości z worka. Nowe podejście Matrix Approximation Sparse Attention (MASA) wprowadza zamkniętą formułę oceny, która mierzy, ile błędu aproksymacji macierzy-iloczynu zmniejsza każda rzadka jednostka. To zmienia problem z heurystycznego wyboru na matematycznie uzasadnioną optymalizację.

Kluczowa zaleta MASA jest praktyczna - jako korekcja oparta na teorii, może być dodana do istniejących frameworków rzadkiej atencji bez zmiany ich kerneli ani budżetów obliczeniowych. Rozległy zestaw eksperymentów obejmujący wiele metod rzadkiej atencji, benchmarków i backbonów LLM-ów wykazał konsystentne wzrosty dokładności. To sugeruje, że zmiana perspektywy z wyboru wartości na aproksymację macierzy jest nie tylko teoretycznie bardziej słuszna, ale również praktycznie skuteczna.