Naukowcy z arXiv zaproponowali Regularized Emphatic Temporal-Difference Learning (RETD), ulepszenie istniejącego algorytmu ETD używanego w reinforcement learning'u przy uczeniu na danych off-policy. Problem polegał na tym, że ETD, choć teoretycznie stabilizuje oczekiwaną aktualizację TD, w praktyce nie gwarantuje stabilności przy stałych rozmiarach kroku w rzeczywistych dynamikach próbkowania.
Aby zademonstrować problem, zespół skonstruował ergodyczny kontrprzyklad - funkcję dwustanową, w której średniowa mapa ETD się kurczy (teoretycznie dobre), ale rzeczywisty iloczyn próbek ma dodatni górny wykładnik Lapunowa (oznaczający niestabilność). Analiza przy pomocy regeneracyjnych cykli wykazała, że niestabilność wynika z nieskończonej wariancji follow-on trace. Propozycja RETD wprowadza znormalizowany mechanizm post-shock repair, przechowujący sygnał w przeciekającym skalarnym stanie i uwalniający opóźnioną korekcję - pozostawiając niezmienione współczynniki ważności i samą trace.
Wyniki teoretyczne pokazują zbieżność dla harmonicznie malejących stepsize'ów oraz warunkowy rezultat kontrakcji momentu dla stałych kroków. RETD uzyskał certyfikowane ujemne wykładniki Lapunowa na problemach testowych gdzie oryginalny ETD wykazywał niestabilność, choć niektóre wyniki pozostają na poziomie numerycznym. Eksperymenty ze 10 tysięcami przebiegów potwierdzają przepowiednie teoretyczne, zmianę dynamiki post-shock i zależność od zadania.