Optymalizator Adam jest standardem w głębokim uczeniu maszynowym, ale jego precyzyjny związek z naturalnym spadkiem gradientu (NGD) pozostawał niejasny. Badanie przeanalizowało pełną regułę aktualizacji Adam zawierającą momentum jako diagonalne przybliżenie empirycznej macierzy Fishera, dodatkowo zakłócone przez obcięcie diagonalne, empiryczne podstawienie etykiet i opóźnienie czasowe.

Badacze mierzyli geometryczne odchylenie Adam od prawdziwego NGD za pomocą metryki niezmienniczej ze względu na skalę na czterech typach krajobrazów strat: dobrze uwarunkowanej regresji liniowej, źle uwarunkowanej regresji liniowej, regresji logistycznej i niewypukłej małej sieci neuronowej. Trajektoria geometryczna Adam zależy od kontekstu - w dobrze uwarunkowanych warunkach odchylenie pozostaje małe, ale w złych warunkach wzrasta do około 10 do 3 potęgi w przypadku sieci neuronowej. Wyższa geometryczna dryf koreluje z wolniejszą optymalizacją na początku, ale nie pogarsza minimalizacji ostatecznej funkcji celu.

Adam konsekwentnie osiąga niskie wartości straty, a ulepszona empiryczna macierz Fishera (iEF) śledzi bardziej stabilne ścieżki niż standardowa empiryczna macierz Fishera, która często oscyluje lub rozbieża. Wyniki sugerują że praktyczna moc optymalizacyjna Adam może wynikać z balansu między błędami strukturalnego przybliżenia a wygładzaniem momentum, a nie z bliskiego śledzenia ścieżki naturalnego gradientu.