Badacze opracowali metodę Teacher-Gated On-Policy Distillation (TGOPD), która zmienia podejście do destylacji modeli językowych w fazie post-treningu. Tradycyjna destylacja na bieżących danych (OPD) pobiera wskazówki od nauczyciela na każdym promptie, ale nie sprawdza, czy nauczyciel faktycznie ma rację. To jest problem, szczególnie gdy nauczyciel jest pewny siebie, ale błędnie wskazuje kierunek - może to wprowadzić studentów model w złe nawyki przez silne, ale mylące sygnały treningu.
TGOPD rozwiązuje to poprzez wprowadzenie bramki wiarygodności. Najpierw system testuje nauczyciela na małym zestawie promptów, którymi weryfikuje jego przewidywania. Gdy nauczyciel przechodzi weryfikację, prompt trafia do standardowej destylacji OPD. Jeśli nie przechodzi, uczenie kierowane jest do alternatywnego podejścia opartego na weryfikatorze, zwanego GRPO. Ta selektywna filtracja zapobiega utrwalaniu błędów nauczyciela.
Wyniki są obiecujące. Metoda wypadła lepiej niż vanilla OPD we wszystkich sześciu testach jednodziedzinych (matematyka, kod, instrukcje) oraz na czterech modelach różnych rozmiarów (4B i 35B parametrów). Dodatkową zaletą jest efektywność zasobów - wykorzystując pojemność nauczyciela do weryfikacji zamiast marnowania jej, system zwiększył GPU utilization z 9,8% do 78,9% w testach asynchronicznego treningu. To pokazuje, że bardziej inteligentne kierowanie procesem destylacji może być zarówno bardziej dokładne, jak i bardziej wydajne.