Naukowcy zaproponowali nowe podejście do uczenia się agentów AI, które zmienia sposób, w jaki modele językowe uczą się z doświadczenia. Zamiast tradycyjnej refleksji na poziomie trajektorii, nowa metoda Stateful Knowledge Learning (SKL) skupia się na utrzymywaniu jawnej, deklaratywnej wiedzy predykcyjnej bezpośrednio związanej ze stanami środowiska. To podejście ma bardziej przewidującą naturę niż hindsight oparte na episodycznych podsumowaniach ścieżek eksploracji.

Teoria stojąca za SKL wynika z obserwacji, że dotychczasowe podejścia reflection-based działają raczej na zasadzie retrospektywnej analizy trajektorii niż prawdziwego przewidywania. Powoduje to, że agenty uczą się kruchych, zależnych od ścieżki heurystyk. Autorzy wprowadzili dwa algorytmy: SKL-SD opary na self-distillation oraz SKL-RL wykorzystujący reinforcement learning. Oba pozwalają agentom autonomicznie ekstrakcji wiedzy predykcyjnej z doświadczenia i nauczyć się jej wykorzystywania w podejmowaniu decyzji.

Eksperymentalnie nowa metoda została przetestowana na złożonych zadaniach: interaktywnych środowiskach takich jak WebShop i ScienceWorld, oraz zadaniach szachowych (ChessPuzzles). Wyniki wykazały znaczną poprawę w stosunku do obecnych podejść opartych na refleksji. Dla praktyki to oznacza, że agenty AI mogą być bardziej generalizowalne i efektywne w nowych, nieznanych sytuacjach, co jest kluczowe dla ich praktycznego zastosowania w realnych problemach wymagających adaptacyjności.