Zespół badawczy opracował Temperon - nową strategię trenowania, która osiąga pełnoczasową jakość algorytmu SAM (Sharpness-Aware Minimization) przy zaledwie jednej trzeciej kosztów obliczeniowych. Podejście łączy eksploracyjną fazę trenowania zwykłym SGD przez pierwszych 43 procent epoki z refinowaniem przy użyciu SAM-oplecionego optymalizatora Muon w końcowej fazie trenowania ze zmiennym learning rate'em (cosine anneal).

Badania na czterech popularmych zbiorach obrazów - CIFAR-10, CIFAR-100, SVHN i Tiny ImageNet - wykazały, że Temperon osiąga nie tylko taką samą dokładność jak metody pełnoczasowego SAM, ale dobiega do trudnych celów dokładności nawet o 35 procent szybciej. Kluczowa rola należy do refinera Muon, który wносит wzrost dokładności o 0,85 procenta punktu. Badacze przeprowadzili dokładne ablacje, aby wyodrębnić znaczenie poszczególnych komponentów - okazało się, że kształt sekwencji explorer'a i jego restarty nie wnoszą istotnego wkładu.

Metoda wykazuje wysoką transferowalność poza wizję komputerową. Podczas trenowania modelu GPT-2 od podstaw Temperon osiąga jakość pełnoczasowego SAM przy 29 procentach szybszym czasie wykonania. W zadaniach fine-tuningu na benchmarku GLUE nigdy nie osiąga gorszych wyników niż pełnoczasowy SAM, a jednocześnie wykorzystuje zaledwie trzecią część jego obliczeniowego kosztu SAM.