Naukowcy opracowali nową metodę optymalizacji - Continuous-Delayed-Memory Stochastic Gradient Descent - która lepiej radzą sobie z modelowaniem złożonych danych czasowych z obserwacji astronomicznych. Algorytm różni się od klasycznego SGD tym, że pamiętuje i wykorzystuje stany poprzednich iteracji, co w testach na dwuwymiarowych krajobrazach optymalizacyjnych pokazało zarówno szerszą eksplorację przestrzeni parametrów, jak i bardziej precyzyjną zbieżność.
Probleem motywujący to badania pochodzi z astrofizyki - kwazary to niezwykle jasne obiekty, których jasność zmienia się w sposób stochastyczny (losowy). Te zmiany kodują informacje o supermasywnych czarnych dziurach je napędzających, ale analiza czystych szeregów czasowych (tzw. light curves) z obserwacji naziemnych to istotne wyzwanie statystyczne. Naukowcy zastosowali tu stochastyczne równania różniczkowe (SDE) wzmocnione parametryzacją neuronową.
Równocześnie zespół zaproponował strukturę wzmacniającego uczenia z ciągłymi w czasie gradientami polityki, która pozwala na badanie polityk eksploracyjnych bez konieczności rozwiązywania równania Bellmana-Hamiltona-Jacobiego (HJB PDE). Wykazali, że warunki optymalności ich podejścia odzyskują politykę Gibbsa z wcześniejszych prac. To połączenie teorii optymalizacji, uczenia maszynowego i fizyki otwiera nowe możliwości dla modelowania zjawisk astronomicznych i może znaleźć zastosowania poza tym polem.