Naukowcy wykazali, że pretrenowany model języka można zmodyfikować poprzez dodanie rekurencyjnej głębi, zachowując jego bazową funkcjonalność i dodając nowe możliwości iteracyjnego rozumowania. Model Qwen2.5-0.5B-Instruct podzielili na trzy części: wstęp, blok rekurencyjny ze wspólnymi wagami i zakończenie, tworząc ścieżkę jednopętlową zachowującą tożsamość modelu i most wejściowy dla kolejnych iteracji.
Kluczowym wynikiem jest to, że mechanizm działa jako procedura wielokrotnego użytku zamiast zwykłego wyszukiwania gotowych odpowiedzi. Retrofit instaluje się przy dwóch budżetach parametrów: 6 milionów wytrenowanych parametrów nad zamrożonymi wagami bazowymi oraz 180 milionów dla pełnego bloku. Model nie pogorszył się na testach w pierwszej pętli i osiągnął porównywalne wyniki - adapter uzyskał 83,8 procent dokładności wobec 84,0 procent dla pełnego bloku. Najważniejsze, że model ekstrapoluje do około 1,5 raza większej głębi niż podczas nadzorowanego treningu, utrzymując 70 procent dokładności przez głębię 18, podczas gdy model porównawczy trenowany ze scratchpadem całkowicie się kończył poza nauczonym horyzontem.
Od strony praktycznej rozwiązanie jest znacznie wydajniejsze - rekurencyjny model odpowiadał 7,6 razy szybciej niż wariant ze scratchpadem. Transfer wiedzy również zadziałał - trening na werbalne wersje zadań startujący z zainstalowanego mechanizmu przewyższył świeży trening o 18,6 punktu procentowego. Te rezultaty sugerują, że możliwe jest efektywne rozszerzanie istniejących modeli o zdolności do głębokich, wielokrokowych rozumowań bez konieczności ponownego trenowania od podstaw.