Naukowcy z arXiv opublikowali Phase-HDC, metodę treningową, która radykalnie zmniejsza wymagania pamięciowe poprzez całkowite wyeliminowanie potrzeby przechowywania historii gradientów w optymalizatorze. Standardowe metody optymalizacji, takie jak Adam, przechowują momenty gradientów zajmujące kilka razy więcej miejsca niż sam model - dla klasyfikatorów hiperdimensjonalnych z parametrami w postaci nisko-bitowych kątów (fazowych) problem ten jest szczególnie dotkliwy.

Phase-HDC zastępuje skomplikowany system śledzenia historii bardzo prostą regułą: każdy parametr zmienia się o maksymalnie jeden krok w kierunku ujemnym wobec znaku aktualnego gradientu, ale tylko gdy gradient ten jest wystarczająco duży. Naukowcy udowodnili matematycznie, że ta prosta reguła jest dokładnym rozwiązaniem pierwszorzedu modelu straty, w którym każda zmiana parametru wiąże się ze stałym kosztem. Rezultaty są imponujące - metoda przechowuje 16-23 razy mniej niż float32 Adam i 4-6 razy mniej niż 8-bitowy Adam, osiągając dokładność zbliżoną do Adama z 6-bitowymi momentami.

Zaletą Phase-HDC jest szczególnie przydatność dla treningu modeli tekstowych na poziomie bajtów, gdzie 8-bitowy Adam całkowicie się zawala, a Phase-HDC radzi sobie znacznie lepiej. Kompromis polega na utracie około pięciu punktów procentowych dokładności w porównaniu do pełnoprecyzyjnego Adama, choć na sześciu z jedenastu testowanych zbiorów danych Phase-HDC przewyższa 8-bitowego Adama. Instrumentacja procesu treningowego wykazuje, że kiedy parametry muszą leżeć na dyskretnej siatce, momenty Adama głównie decydują o tym, czy parametr w ogóle się zmienia - decyzję tę próg gradientu może podejmować bez dodatkowej pamięci.