Linear attention - mechanizm pozwalający modelom pracować z ustalonym rozmiarem stanu bez rosnących kosztów obliczeniowych - zmagają się z coraz trudniejszym problemem: przy długich kontekstach wiele informacji kompresuje się w jednym stanie, powodując wzajemną interferencję. To zmniejsza zdolność modelu do prawidłowego odczytania konkretnych informacji z przeszłości. Dotychczasowe rozwiązania, w tym model Gated DeltaNet-2 (GDN-2), zawsze usuwały stare informacje na podstawie klucza bieżącego tokena, ale ten kierunek nie uwzględniał samego zapytania, które właściwie mierzy interferencję.
Nowe podejście Query-derived Erase Direction (QED) zmienia to, dodając drugi, niezależny kierunek usuwania oparty na zapytaniu. Kluczowa innowacja polega na tym, że ten nowy kierunek jest ortogonalny (prostopadły) do klucza - matematycznie oznacza to, że edycja na podstawie klucza nie może zmienić części stanu, którą zmienia zapytanie. W praktyce QED używa tego edytowalnego fragmentu do aktywnego cancelowania starych treści mierzonych wzdłuż kierunku zapytania, a nie przypadkowego usuwania zawartości.
Wyniki są imponujące: metoda poprawia odczyt informacji na każdej długości kontekstu przekraczającej okno treningowe, a na benchmark S-NIAH-1 praktycznie podwaja użyteczną długość kontekstu. To otwiera drogę do bardziej efektywnych transformerów zdolnych do pracy z naprawdę długimi ciągami tekstu bez eksplozji pamięciowych kosztów.