Naukowcy z arXiv opublikowali pracę nad Progress-conditioned Group Policy Optimization (ProGPO), metodą rozwiązującą fundamentalny problem w trenowaniu agentów AI dla długoterminowych zadań. Dotychczasowe podejścia do optymalizacji polityki bazowane na grupach ulegają pułapce: gdy model LLM napotyka trudne zadanie, ciągle powielą nieefektywne akcje zamiast eksplorować nowe stany, co prowadzi do braku sygnału zwrotnego od systemu nagradzającego.

Klucz do ProGPO leży w zmianie myślenia o tym, co zasługuje na nagrodę w grupach w pełni nieudanych prób. Zamiast czekać na zewnętrzną nagrodę (której nie będzie), metoda przyznaje wyższą wartość trajektoriom, które odkrywają nowe obserwacje w środowisku. To ma głęboki sens: żeby rozwiązać skomplikowane zadanie, trzeba najpierw dotrzeć do niezbadanych stanów. Eksperyment przeprowadzono na dwóch wymagających benchmarkach - ALFWorld i WebShop - testując modele Qwen2.5-1.5B i 7B-Instruct. ProGPO konsekwentnie przebijała granice poprzednich podejść grupowych, a największe skoki wydajności pojawily się właśnie na najtrudniejszych wariantach problemów.

Znaczenie tej pracy wykracza poza jeden benchmark. Problem braku efektywnego sygnału zwrotnego dla agentów AI na trudnych zadaniach wieloetapowych to jeden z głównych wyzwań branży. Jeśli ProGPO zadziała niezawodnie na szerszym spektrum problemów, może otworzyć drogę do bardziej niezawodnych autonomicznych systemów zdolnych do faktycznego planowania i eksperimentacji zamiast bezwładnego powtarzania wzorców.