Zespół badaczy przedstawia teoretyczną analizę oryginalnego algorytmu AdaGrad działającego w warunkach szumu o grubych ogonach (heavy-tailed noise) i uogólnionej gładkości funkcji. Kluczowe odkrycie dotyczy problemu zwanego anisotropicznym błędem kalibracji - gdy brak clippingu, adaptacyjny mianownik w AdaGradzie uczy się geometrii rzadkich skoków szumu zamiast rzeczywistej krzywizny optymalizowanej funkcji, co prowadzi do trwałych zniekształceń kierunkowych uniemożliwiających postęp.
Clipping okazuje się być nie tylko heurystyką poprawiającą odporność, ale fundamentalnym mechanizmem stabilizującym adaptacyjną geometrię algorytmu. Badacze dostarczają gwarancję skończonego horyzontu wysokiego prawdopodobieństwa dla nieopóźnionej aktualizacji AdaGrad z wartością przeciętną normy gradientu O(d(sqrt(log T) + log 1/delta) / sqrt(T)), co daje złożoność O-tilda(epsilon do -2).
To odkrycie ma istotne implikacje praktyczne: pokazuje że clipping w metodach adaptacyjnych nie jest zbędnym dodatkiem, ale kluczowym elementem zapewniającym poprawne działanie w realistycznych scenariuszach z szumem. Rezultaty wpływają na zrozumienie i projektowanie nowoczesnych optymalizatorów używanych w trenowaniu sieci neuronowych, gdzie heavy-tailed szum jest powszechny.