Badacze z arXiv opublikowali analizę metody OrthoGrad, która zmienia sposób, w jaki gradientowe aktualizacje są stosowane do wag sieci neuronowych. Zamiast standardowej metody optymalizacyjnej, OrthoGrad usuwa część gradientu równoległą do aktualnego wektora wagi, pozostawiając tylko składnik ortogonalny. Celem jest zbadanie, jak taka interwencja geometryczna wpływa na zapamiętywanie szumnych etykiet - fundamentalny problem w nowoczesnym głębokim uczeniu.
W eksperymentach na zbiorze MNIST z ograniczoną liczbą przykładów treningowych OrthoGrad wykazywał najwyraźniejszą poprawę dokładności testowej dla sieci splotowych (CNN), jednocześnie zmniejszając dopasowanie do zniekształconych etykiet. Mechanizm działania wskazuje, że projekcja ma najsilniejszy wpływ, gdy surowy gradient zawiera znaczący składnik radialny. W większych zbiorach danych gradienty są już naturalnie bliżej ortogonalne wobec wag, co zmniejsza efekt metody. Dodatkowo przeprowadzone doświadczenia z ResNet-18 na CIFAR-10 pokazały, że OrthoGrad może zmienić trajektorie zapamiętywania, ale nie zapobiega ostatecznie zapamiętywaniu szumnych etykiet.
Wyniki sugerują, że ortogonalne ograniczenia aktualizacji mogą być przydatne narzędziem diagnostycznym do studiowania dynamiki uczenia się sieci neuronowych. Jednak metoda nie jest uniwersalnym regularyzatorem - jej efektywność mocno zależy od reżimu danych i rozmiaru zbioru treningowego. Badanie dokumentuje, kiedy i dlaczego ta geometryczna interwencja w optymalizator ma znaczenie dla kontrolowania nadmiernego dopasowania.