Destylacja on-policy (OPD) to technika szkolenia modeli językowych, w której mniejszy model uczy się od większego poprzez naśladowanie jego trajektorii decyzyjnych. Dotychczasowe podejście traktowało wszystkie informacje zwrotne od nauczyciela jednakowo, zakładając że jego nagrody dobrze odzwierciedlają postęp w rozumowaniu. Problem w tym, że założenie to się nie sprawdza - model nauczyciela może penalizować kroki, które faktycznie stanowią przełom w myśleniu, bo są formułowane inaczej niż jego typowa odpowiedź.
Nowa metoda R2-OPD (Reasoning-Progress-Aware Reward Filtering) tworzy dla każdej sekwencji myśli dwa niezależne rankingi: jeden oparty na nagrodach nauczyciela, drugi na osobno szacowanym postępie rozumowania. Gdy rankingi się różnią, system zmniejsza wiarygodność nauczycielskiego sygnału, aby uniknąć karania poprawnego rozumowania tylko za to, że wyglądało inaczej. Jednocześnie zachowuje konstruktywne wskazówki od nauczyciela tam, gdzie się zgadzają.
Wyniki pokazują konsystentną poprawę nad standardowym OPD, szczególnie w zadaniach wymagających złożitego rozumowania. To istotne, bo destylacja jest kluczowym sposobem na robienie mniejszych, bardziej praktycznych modeli bez utraty zdolności do złożonego myślenia. Zamiast ślepo naśladować nauczyciela, model uczy się teraz rozumieć, kiedy powinien iść własną drogą.