Naukowcy z arXiv opracowali Trace - framework do indukcji executable Walkthrough Memory z trajektorii o rzadkich nagrodach. Głównym wyzwaniem jest fakt, że rzeczywiste doświadczenia agentów zawierają błędy, pętle i niepotrzebne obejścia, podczas gdy tradycyjne podsumowania zazwyczaj pomijają warunki stanów i zależności między akcjami potrzebne do ich wykonania.
Kluczową obserwacją jest to, że przypisanie kredytu za rezultaty (delayed credit) wskazuje, które akcje wiążą się z postępem, ale nie określa, czy produkują one fakty wymagane przez późniejsze akcje. Trace rozwiązuje ten problem poprzez trójfazowy proces: najpierw wykrywa "punkty postępu" na podstawie nagród i trwałych zmian stanu, propaguje kredyt do identyfikacji wartościowych przejść, a następnie estymuje warunki wstępne akcji z dowodów sukcesu i porażki z różnych epizodów.
Metoda obejmuje również backward dependency slicing - śledzenie wymaganych faktów do ich producентów i ekstrakcję łańcuchów akcji wolnych od zależności, jednocześnie usuwając irrelewantne pętle i detours. Wynikowe Walkthroughs kodują warunki wejścia, uporządkowane sekwencje stan-akcja-efekt oraz predykaty ukończenia i porażki. Eksperymenty na J-TTL, WebShop i ScienceWorld z trzema otwartymi LLM-ami wykazały, że Trace konsekwentnie przewyższa osiem istniejących metod uczenia się agentów, umożliwiając im bardziej efektywne uczenie się z doświadczenia i wznowienie z pośrednich stanów.