Naukowcy opracowali PATR (Process-Scorer Guided Adaptive Tree Rollout), nowy algorytm treningu agentów oparty na reinforcement learningu, który znacznie bardziej efektywnie niż dotychczasowe podejścia eksploruje przestrzeń możliwych rozwiązań. Zamiast standardowego podejścia polegającego na niezależnym próbkowaniu wielu kompletnych trajektorii, PATR wykorzystuje strukturę drzewa, gdzie każdy ruch agenta stanowi punkt decyzyjny.
Kluczowa innowacja polega na użyciu oceny procesu do identyfikacji obiecujących stanów pośrednich. Algorytm selektywnie rozgałęzia się z tych stanów, ponownie wykorzystuje wspólne prefiksy trajektorii i konserwatywnie przerywa bezowocne ścieżki, aby zminimalizować zmarnowany budżet obliczeniowy. To jest szczególnie ważne w zadaniach wieloetapowych, gdzie tradycyjny uniform rollout strategy marnotrawy energię na martwe ścieżki, zamiast dogłębnie eksplorować kierunki prowadzące do rozwiązania.
Wydajność metody testowano na dwóch benchmarkach: FrozenLake i SWE-Bench (zbiór rzeczywistych problemów z inżynierii oprogramowania). Wyniki pokazały poprawę wydajności o 5 punktów na SWE-Bench i 9,3 punktu na FrozenLake w porównaniu z metodami baseline'u. PATR pozostaje kompatybilny ze standardowymi algorytmami optymalizacji polityki, co czyni go praktycznym rozszerzeniem istniejących podejść do treningu agentów AI.