Badacze zaproponowali LoopOPD - framework do treningu Looped Language Models, czyli modeli, które efektywnie parametrycznie skalują rozumowanie poprzez ponowne użycie wspólnych parametrów w wielokrotnych krokach. Głównym wyzwaniem istniejących podejść jest otrzymywanie efektywnego nadzoru treningowego bez konieczności używania zewnętrznych nauczycieli lub dodatkowych informacji uprzywilejowanych.
Rozwiązanie opiera się na pomysłe samo-nadzoru. LoopOPD wykorzystuje zamrożoną politykę z głębszych pętli modelu jako nauczyciela dla warstw pośrednich, tworząc gęsty nadzór na podstawie własnych obliczeń. To eliminuje potrzebę zewnętrznego nauczyciela lub specjalnych informacji. Dynamiczna wersja, D-LoopOPD, idzie dalej - nauczyciel (głębsza pętla) jest ciągle odświeżany w miarę aktualizacji wspólnych parametrów modelu, tworząc mechanizm recurrentnego samo-doskonalenia się.
Badacze teoretycznie scharakteryzowali, jak aktualizacje distylacji rozprzestrzeniają się na różnych głębokościach pętli i wyprowadzili warunki, pod którymi pojedyncza aktualizacja poprawia zmultyplikowaną zdolność na obu poziomach. Eksperymenty na modelach Ouro-Thinking wykazały, że LoopOPD znacznie poprawia rozumowanie matematyczne, a D-LoopOPD osiąga dodatkowe zyski poprzez dynamiczne odświeżanie nauczyciela. To podejście ma potencjał do bardziej efektywnego treningu modeli skupionych na rozumowaniu bez dodatkowych zasobów etykietowania.