Naukowcy wykazali, że zdolności w modelach językowych nie pojawiają się stopniowo, ale w wyniku gwałtownego wyrównania wszystkich części danego obwodu neuronowego w jednym stochastycznym momencie. Biorąc częściowy postęp w rozwiązywaniu problemu nie przynosi żadnych praktycznych korzyści - wszystkie komponenty muszą się wyrównać razem. To jest krytycznym ograniczającym etapem w formowaniu się nowych zdolności modelu.

W eksperymentach na Pythii przeanalizowali siedem zdolności na trzech skalach. Gdy usunęli jedną część obwodu, pozostało średnio 17% zdolności, podczas gdy teoria mówiąca o częściowych kredytach przewidywała 50-83%. Liczba brakujących części determinuje czas oczekiwania, a nie rozmiar całego obwodu - pięcioczęściowy obwód z trzema brakującymi częściami czeka podobnie długo co trójczęściowy w tej samej sytuacji.

Naukowcy sformułowali prawo kinetyki w formie równania: miejsca x próby x siła napędzająca x ekspansja wykładnicza funkcji barierowej, minus destrukcja. Wykorzystując ten model potrafili przewidywać moment pojawienia się zdolności z medianą błędu 5% na wcześniej niewidanych modelach. Odkryli też niebezpieczny efekt - trenowanie bez pewnej zdolności może trwale uniemożliwić jej opanowanie mimo że loss validacyjny spada normalnie. Rozwiązanie polega na reinicjalizacji tylko specyficznych parametrów w heads modelu.