Naukowcy opracowali teoretyczną ramę Guidance-Augmented GRPO (GA-GRPO), która analizuje, w jaki sposób zewnętrzne wskazówki - takie jak ścieżki eksperckie, samowyjaśnienia lub pobierane wzorce myślenia - wpływają na trenowanie dużych modeli językowych. Dotychczasowe metody (LUFFY, ExPO, PAPO, TAPO) wykazywały empiryczne ulepszenia, ale brakowało im formalnej teorii o szybkości zbieżności i optymalnych parametrach.
GA-GRPO modeluje zewnętrzne wskazówki jako stochastyczny operator G, który zmienia rozkład pytań. Autorzy dowiedli, że algorytm zbiegał się z szybkością O(1/sqrt(T)) do otoczenia punktu stacjonarnego GRPO, a błąd biasu jest ograniczony divergencją total-variation delta_G między rozkładem ze wskazówkami a rozkładem modelu. Kluczowy wynik to wyprowadzenie zamkniętej formy dla optymalnej wagi wskazówek: lambda-star(T, delta, sigma_0 squared) = sigma_0 squared / (sigma_0 squared + R_max squared delta squared T).
To badanie ma istotne znaczenie dla praktyków, bo wyjaśnia na poziomie teoretycznym, kiedy wskazówki rzeczywiście pomagają, a kiedy mogą być szkodliwe. Dostarczając konkretne wzory i granice zbieżności, rama pozwala optymalizować wagi wskazówek na podstawie charakterystyk konkretnego problemu, co może znacznie poprawić efektywność trenowania systemów rozumowania w modelach AI.