Naukowcy z arXiv odkryli uniwersalną zależność matematyczną między właściwościami danych treningowych a tym, jak zmieniają się wagi w transformatorach. Skalę rozkładu Weibulla opisującego wielkości wag można przewidzieć za pomocą bigram conditional entropy - statystyki czystej danych, obliczanej jeszcze przed treningiem.

Klucz do odkrycia to prosta obserwacja: podczas gdy kształt rozkładu pozostaje stabilny (k ok. 1,2) we wszystkich warstwach i modelach, parametr skali lambda zmienia się w przewidywalny sposób w zależności od redundancji danych. Naukowcy sformułowali prawo skalowania lambda-kwadrat minus lambda-zero-kwadrat równa się stałemu członowi zależnemu od tempa uczenia plus człon zależny od entropii danych podniesiony do potęgi 0,59. Wykładnik 0,59 nie został dopasowany do danych treningowych, ale pochodzi niezależnie zmierzonego zjawiska nasycenia po stronie danych - co sugeruje głęboką strukturę tego zjawiska.

Experymentalne potwierdzenie jest imponujące: 23 przebiegi obejmujące rząd wielkości różnych temp uczenia idealnie się zsuwają, gdy uwzględni się przepisaną entropię. Otrzymany współczynnik R-kwadrat wynosi 0,941 dla przewidywania wewnątrz rodziny danych treningowych, a błąd względny osiąga zaledwie 5,7 procent. Prawo to działa konsekwentnie na poziomie całego modelu i poszczególnych warstw, oraz zachowuje się dla dwóch testowanych architektur. Granice skuteczności pojawią się przy przewidywaniu cross-corpus na kodzie, co wskazuje na redundancję jako drugi wymiar wpływu danych na dynamikę treningu.