Badacze z arXiv opublikowali artykuł kwantyfikujący moment, w którym sieci neuronowe przechodzą od zapamiętywania treningu do rzeczywistej generalizacji - zjawisko znane jako grokking. Do tej pory teoretycy rozumieli, dlaczego to się dzieje, ale nikt nie zmapował precyzyjnie, kiedy dokładnie następuje to przejście w przestrzeni hiperparametrów.
Zespół przebadał 384 różnych konfiguracji dwuwarstwowych MLP na zadaniach arytmetyki modularnej i odkrył uniwersalne prawo skalowania: czas grokkingu skaluje się jako T ~ H^-0.27 * D^-2.04 * eta^-0.50 * lambda^-0.64, gdzie H to szerokość modelu, D to złożoność danych, eta to learning rate, a lambda to weight decay. Model wyjaśnia ponad 73 procent wariancji (82 procent z interakcjami). Najbardziej zaskakujący wynik: zwiększenie rozmiaru datasetu o połowę przyspieszsa przejście do generalizacji czterokrotnie, podczas gdy podwojenie szerokości sieci daje jedynie przyśpieszenie 1.2 razy. To oznacza, że w praktyce warto inwestować w lepsze dane, a nie większe modele.
Badacze odkryli też ostrą granicę fazową przy współczynniku regularyzacji (weight decay) równym 1.0 - poniżej tej wartości sieć grokuje, powyżej nie. Analizie trajektorii norm wag podczas przejścia pokazała monotoniczne zmniejszanie się - proces znany jako implicit regularization, który naturalnie prowadzi do wyboru prostszych rozwiązań. Te wyniki dają konkretne narzędzia do przewidywania i kontrolowania, kiedy i jak overparameteryzowane sieci nauczą się uogólniać na nowe dane.