Naukowcy opracowali AdvRole, framework który zmienia szkolenie agentów role-playingowych w adaptacyjny, oparty na algorytmach wzmacniania proces nauki. Zamiast trenować na stałym zestawie scenariuszy przygotowanym przed rozpoczęciem nauki, system alternuje między Aktorem uczącym się grać role postaci a Rewriterem, który modyfikuje profile postaci i konteksty dialogów w celu stworzenia scenariuszy ukierunkowanych na konkretne słabości agenta.
Głównym problemem, który AdvRole rozwiązuje, jest dystrybuyjne wąskie gardło w tradycyjnych metodach RL. Gdy agent poprawia swoje umiejętności, zmieniają się również scenariusze, w których radzi sobie słabo, ale pulę treningową pozostaje statyczna. Rewriter trenuje się z nagrodą opartą na luce wydajności - premiuje zmiany, które zmniejszają wynik Aktora w porównaniu do oryginalnego scenariusza, tworząc ciągle ewoluującą, zdolną curriculum.
W eksperymentach na trzech benchmarkach role-playingowych obejmujących język angielski i chiński, plus nowym multillingwalnym benchmarku wypuszczonym przez autorów, AdvRole konsekwentnie przewyższał linie bazowe. Podejście jest szczególnie znaczące dla personalizowanych asystentów i symulacji społecznych, gdzie umiejętność adaptacji do zmieniającego się zachowania użytkownika jest krytyczna.