Badacz z Princeton zaproponował Recurrent Looped Transformer (RLT) - nową architekturę, która fundamentalnie zmienia sposób komunikacji między tokenami w modelach językowych. W obecnych modelach dekoder-only ostatnia warstwa obliczona dla tokena t w ogóle nie wpływa na pierwszą warstwę tokena t+1 - informacje przepływają jedynie poprzez mechanizm attention nad zapisanymi kluczami i wartościami. RLT zamyka tę lukę, przenosząc pełny stan dekodera (finalny output oraz cache sliding-window attention z każdej warstwy) bezpośrednio do następnego tokena.

Architektura RLT łączy koder przyczynowy z dekoderem rekurencyjnym. Koder przetwarza tokeny równolegle, generując reprezentacje, z których projekcja tworzy pamięć klucz-wartość dla dekodera. Dekoder utrzymuje pełny stan H_t złożony z finalnego outputu oraz zachowywanych SWA cachów ze wszystkich warstw. Dla każdego tokena operacja scalania łączy nową reprezentację z poprzednim outputem, a następnie każdy blok dekodera wykonuje kauzalne sliding-window attention, attention do pamięci enkodera oraz warstwę FFN.

Ważne jest wyjaśnienie, że artykuł Yifana Zhanga stanowi jedynie specyfikację projektową - definiuje architekturę, harmonogramy wykonania i zasady replay, ale autor wyraźnie nie raportuje żadnych zmierzonych wyników dotyczących wydajności, jakości rozumowania czy zachowania się na różnych skalach. To sugeruje, że propozycja jest na etapie koncepcyjnym i wymaga empirycznej walidacji, zanim będzie wiadomo, czy takie podejście rzeczywiście poprawia zdolności modelu do modelowania zależności czasowych.