Naukowcy z arXiv opublikowali LISA (Linear-Indexed Sparse Attention), wtyczkę do modeli AI, która drastycznie przyspieszza przetwarzanie długich sekwencji tekstu. Problem jest prosty - obecnie używana atencja ma złożoność O(n2), co oznacza, że koszt rośnie kwadratowo wraz z długością tekstu. W przypadku modeli typu DeepSeek-R1, które pracują z bardzo długimi łańcuchami rozumowania, prowadzi to do niedopuszczalnych czasów przetwarzania.
LISA rozwiązuje to kombinacją dwóch podejść pracujących jednocześnie. Pierwszy moduł to Linear Attention z czasem O(n), który utrzymuje pamięć długodystansową. Drugi to dynamiczny indekser (Lightning Indexer), który wybiera M najważniejszych tokenów z całego kontekstu i podaje je do standardowej rzadkiej atencji. Oba strumienie łączone są przez mechanizm gating, redukując złożoność do O(nM), gdzie M jest znacznie mniejsze od n. Sprytnie, LISA nie wymaga pełnego ponownego treningu od zera - można ją załadować do istniejących modeli.
Wdrażanie obejmuje dwuetapowy proces treningowy. Na pierwszym etapie integruje się liniową atencję z mechanizmem attention sliding-window, optymalizowanym przez destylację wiedzy na wzór zamrożonego modelu nauczyciela. Na drugim etapie dodaje się indekser, który zastępuje statyczne okno dynamicznym wyborem z szerszych kontekstów. To podejście jest szczególnie ważne dla produkcji, gdzie długie łańcuchy rozumowania stały się trendem, ale infrastruktura nie zdąża za rosnącymi wymaganiami obliczeniowymi.