Naukowcy zaproponowali SARA - Sequential Adaptive Rollout Allocation - nową metodę dla Reinforcement Learning with Verifiable Rewards (RLVR), która drastycznie zmniejsza potrzeby obliczeniowe. Problem tkwi w tym, że podczas zbierania danych treningowych poprzez generowanie odpowiedzi na prompty, wiele z nich trafia do nasyconych grup, gdzie wszystkie odpowiedzi są albo poprawne, albo błędne, co nie dostarcza przydatnych sygnałów dla aktualizacji modelu.

Istniejące podejścia próbują rozwiązać to przez oversampling większych zbiorów kandydatów lub prognozowanie trudności promptu przed próbkowaniem, ale oba rozwiązania są kosztowne lub zawodne. Kluczowa obserwacja zespołu: efektywność grupy promptów zwykle decyduje się już w kilku pierwszych próbkach. SARA traktuje alokację rolloutów jako problem optymalnego zatrzymania z ograniczonym budżetem, utrzymując bayesowską posteriorową dla wskaźnika sukcesu każdego prompta. Algorytm stosuje dwustrefową regułę decyzyjną - zobowiązuje się do efektywnych grup, porzuca nasycone po krótkiej eksploracji i przealokuje zwolniony budżet na nowe prompty bez generowania dodatkowych pomocniczych danych.

W eksperymentach na zadaniach matematycznych i planowaniu z modelami 1.5B i 3B na pojedynczym GPU, SARA osiąga porównywalne wyniki do konkurencyjnych metod, ale wykorzystując 22 procent mniej rolloutów. Naukowcy dowodzą formalnie niezawodności porzucania nasyconych grup, oczekiwanych oszczędności rolloutów i dominacji w scenariuszach ze stałym budżetem.