Zespół badaczy z arXiv opublikował artykuł o nowej architekturze o nazwie Elastic Threshold Attention, która rozwiązuje problem wąskiego gardła pamięci w dekoderach przetwarzających długie sekwencje tekstu. Metoda ta dynamicznie wybiera, które tokeny z pamięci kluczy i wartości (KV cache) są istotne dla każdego kroku generowania tekstu, umożliwiając przyspieszenie przetwarzania bez spadku jakości.
Tradycyjne podejścia do rzadkości uwagi stosują sztywne reguły heurystyczne, które eliminują fragment kontekstu bez możliwości adaptacji. ETA zmienia tę strategię poprzez zastosowanie nauczalnych progów dynamicznych wyprowadzanych bezpośrednio z reprezentacji zapytań. Innowacyjna część polega na tym, że podczas treningu system nie usuwa zdecydowanie poniżej-progowych logitów, lecz stopniowo je tłumi w kierunku zera. To podejście powoduje, że model unika załamania reprezentacji i pozwala się mu nauczyć, które tokeny rzeczywiście warte są uwagi, podczas gdy inne mogą być ignorowane.
Model z 1,45 miliarda parametrów trenowany tą metodą uzyskuje około 85 procent rzadkości podczas treningu i 38 procent aktywnej gęstości dekodowania, jednocześnie dorównując wydajności pełnej uwagi w testach dotyczących modelowania języka, rozumowania zdrowozmysłowego i wyszukiwania informacji w długim kontekście. Zespół zaimplementował także dedykowany kernel dekodujący w Trionie, co oznacza praktyczne przyspieszenie sprzętowe. To znaczący postęp dla deploymentu dużych modeli, które muszą radzić sobie z długimi dokumentami bez drastycznego wzrostu kosztów obliczeniowych.