Badacze arXiv zbadali fundamentalne pytanie - gdzie dokładnie w Transformerze zachodzi przejście od memorizacji do generalizacji, czyli grokking. Zamiast tradycyjnych podejść wprowadzili Transition Games, czyli behawioralnie wyrównane gry aktywacji z parami kontrolnymi bez generalizacji, które pozwalają precyzyjnie śledzić gdzie funkcjonalnie wyraża się ta zmiana.

Wyniki mogą być zaskakujące dla wielu badaczy zajmujących się głębokim uczeniem. Zamiast znaleźć czysty przełącznik między modułami, naukowcy odkryli rozproszoną użyteczność rozmieszczoną na wielu komponentach. Zwłaszcza istotna jest perspektywiczna tendencja attention bias w bloku 0, a do 92 procent kontrastu addycji można wyjaśnić wybranym trybem drugiego stopnia. Jednocześnie droga w bloku 1 MLP mediuje więcej efektu niż wszystkie inne testowane ścieżki na poziomie 12 z 12 par.

Pracę uderzają opóźnienia w konwencjonalnej mądrości dotyczącej Transformerów. Popularna predykcja, że MLP memorizuje a attention generalizuje, okazała się się odwrócona w analizie autorów - spadek 0.331 bitów na przykład w anchor pamięci oraz zero z dwunastu w przewidywanym kierunku. Równocześnie inne popularne teorie, takie jak routing onset czy global rank collapse, również zawiodły. Oznacza to, że grokking należy postrzegać nie jako przełączenie się między osobnymi modułami, lecz jako spektralne rekodowanie już istniejącego rozproszonego obwodu sieciowego.