Naukowcy ze University of Michigan i OpenAI przeprowadzili badanie na temat tego, ile promptów potrzebuje destylacja on-policy do efektywnego treningu modeli studenckich. Zamiast traktować szerokość promptów i częstość odświeżania rolloutów osobno, przeanalizowali ich wspólne oddziaływanie na wyniki.
W eksperymencie z zadaniami matematycznymi, gdzie utrzymywali stałą liczbę trajektorii (14 080) i aktualizacji optymizatora (110), zmieniali bank promptów i liczbę snapshot polityk generujących odpowiedzi. Kluczowe odkrycie: osiem promptów z dziesięcioma snapshoty osiągnęło 24,09 procent średniej dokładności, prawie identycznie jak 14 080 zupełnie różnych promptów (24,51 procent). To sugeruje, że sieć promptów może być znacznie węższa niż dotychczas sądzono.
Jednak dynamika zmieniła się dramatycznie w zależności od strategii danych treningowych. Gdy odpowiedzi były zamrożone przy początkowej polityce, zwiększanie liczby promptów faktycznie pogorszyło dokładność z 21,16 procent do 19,05 procent. Natomiast przy odświeżaniu polityki przed każdą aktualizacją, rozszerzenie promptów podniosło wynik z 23,61 procent do 25,57 procent. Ta interakcja wyniosła 4,07 punktu procentowego, z przedziałem ufności 95 procent od 2,00 do 6,28 punktu.
Dodatkowe eksperymenty z dwoma uczycielami ujawniły drugą interakcję: modele z okresowym odświeżaniem miały lepszą dokładność przy niskim budżecie obliczeń, ale zamrożone modele je przewyższały przy limicie 32 tysiące tokenów wyjściowych, zużywając 1,7-1,8 raza więcej tokenów. Rezultaty sugerują, że efektywność promptów w destylacji on-policy nie jest stała - zależy zarówno od strategii odświeżania danych jak i dostępnego budżetu obliczeniowego na etapie wnioskowania.