Zespół badawczy zaprezentował SpecLA, nowy system do efektywnego spekulacyjnego dekodowania dla modeli z uwagą liniową, który osiąga przyspieszenie do 1,70 razy szybsze dekodowanie w stosunku do tradycyjnego autoregresywnego podejścia. Głównym wyzwaniem jest to, że liniowe modele atencji operują na stanach rekurencyjnych zamiast cache'a KV charakterystycznego dla transformerów, co wymaga fundamentalnie innych strategii weryfikacji.

SpecLA rozwiązuje ten problem poprzez trzy kluczowe innowacje. Po pierwsze, używa jąder świadomych topologii do weryfikacji zarówno sekwencji jak i drzew kandydatów, zachowując kontrolę nad zależnościami rekurencyjnymi. Po drugie, przechowuje zwarte współczynniki wytwarzane podczas weryfikacji, umożliwiając odzyskanie zaakceptowanych trajektorii stanu bez ponownych obliczeń. Po trzecie, łączy przycinanie oparte na zaufaniu z draftrem w stylu EAGLE wyrównanym z modelem docelowym, aby unikać marnowania pracy weryfikacyjnej na bezużytecznych kandydatach.

Ta praca jest istotna dla rosnącego segmentu modeli linear-attention, które zyskują na popularności dzięki znacznie mniejszym wymaganiom pamięciowym w porównaniu do transformerów. Osiągnięcie 1,70-krotnego przyspieszenia na H100 pokazuje praktyczną wartość specjalizowanego podejścia do dekodowania - zamiast próby adaptacji istniejących technik spekulacyjnych. Może to przyspieszyć przyjęcie linear-attention modeli w produkcyjnych systemach, gdzie szybkość generowania jest krytyczna.