Naukowcy opracowali nowy sposób na poprawę stabilności szkolenia agentów sztucznej inteligencji w uczeniu przez wzmacnianie poprzez zmniejszenie zmienności obliczeń przypisania kredytu. Problem przypisania kredytu polega na tym, że agent musi zrozumieć, które z jego decyzji faktycznie wpłynęły na ostateczny wynik - a w skomplikowanych scenariuszach rozróżnienie pomiędzy ważnymi a nieistotnymi akcjami jest niezwykle trudne. Zaproponowane rozwiązanie wykorzystuje rozumowanie konterfaktyczne, czyli analizę tego, co mogłoby się stać inaczej, gdyby agent podejmował odmienne decyzje na poszczególnych etapach.
Metoda opiera się na identyfikacji alternatywnych ścieżek decyzji - innymi słowy, badacze patrzą na scenariusze, które się nie zdarzyły, ale potencjalnie mogłyby się zdarzyć. To pozwala bardziej precyzyjnie zrozumieć, jaki był rzeczywisty wpływ każdej konkretnej akcji na końcowy rezultat. Dzięki temu wariancja - czyli zmienność wyników między poszczególnymi przebiegami treningu - znacznie się zmniejsza. To ma praktyczne znaczenie dla agentów RL szkolonych w złożonych, nieprzewidywalnych środowiskach, gdzie tradycyjne metody obliczania przypisania kredytu prowadzą do niestabilnego uczenia się i wolniejszych postępów.
Dla branży AI oznacza to konkretną poprawę w zakresie efektywności szkolenia zaawansowanych systemów decyzyjnych. Bardziej stabilne uczenie przekłada się na szybsze konwergencje, mniejsze zapotrzebowanie na moc obliczeniową i bardziej wiarygodne wyniki w systemach wykorzystywanych do autonomicznych decyzji, robotyki czy gier strategicznych.