Naukowcy połączyli geometrię spektralnych aktualizacji w stylu Muon z lokalnym uczeniem - podejściem trenowania każdej warstwy niezależnie bez globalnego backpropagation. Rezultatem jest metoda, która utrzymuje stabilność na znacznie głębokich sieciach neuronowych przy jednym, niezmiennym współczynniku uczenia.

Lokalnego uczenie jest obiecujące ze względu na potencjał do pełnego równoległego trenowania warstw, ale tradycyjnie cierpi na degradację dokładności wraz ze wzrostem głębokości i wymaga delikatnego dostrajania hiperparametrów. Na benchmarkach CIFAR-10 z MLP o różnych wymiarach - od 12 do 48 warstw i od 128 do 2048 neuronów - nowa spektralna metoda osiąga 42,7 procent dokładności z jednym współczynnikiem uczenia, podczas gdy local Adam pada poniżej 31,3 procenta nawet po ponownym dostrajaniu dla każdej głębokości. W wariancie z szerokością 512 spektralna aktualizacja uzyskuje 48,9 procenta wobec 46,6 procenta dla Adama.

Kluczowa innowacja to sformułowanie współczynnika uczenia jako drift contract - relacji lr = epsilon / RMS(input), która ogranicza zmianę aktywacji każdej warstwy w każdym kroku. Badacze wykazali, że to sama spektralna geometria, a nie reguła określająca współczynnik uczenia, odpowiada za większość odporności na głębokość. Odkrycie to może istotnie zmienić sposób trenowania bardzo głębokich sieci, eliminując jedno z głównych wyzwań lokalnego uczenia.