Naukowcy zaproponowali ThinkReset - metodę radzenia sobie z fundamentalnym problemem podczas długiego łańcucha myślenia w modelach językowych. Zamiast skupiać się na kompresji trajektorii lub kontroli w czasie testowania, podejście wprowadza uczalne interfejsy pośrednie, które mogą zastąpić odrzuconą historię i wspierać kontynuowanie rozwiązywania problemu.
Klucz do innowacji leży w rozpoznaniu wadliwości istniejących metod opartych na nagrodach: gdy model nie rozwiąże zadania przed wyczerpaniem okna kontekstowego, nagroda za ostateczną odpowiedź zachęca do pochopnego zgadywania zamiast dalszego ostrożnego rozumowania. ThinkReset rozwiązuje to bezpośrednio optymalizując sukces kontynuacji po resetowaniu kontekstu, a nie nagradzając prematurowe odpowiedzi.
Metoda funkcjonuje w przestrzeni tekstowej poprzez jawną konstrukcję wielokrotnie użytecznych interfejsów za pośrednictwem zapisania interfejsu i resetu. Eksperymenty na wielu benchmarkach rozumowania na długich horyzontach pokazują konsystentne poprawy wskaźników sukcesu przy ustalonych oknach kontekstowych, co stanowi znaczący postęp w radzeniu sobie z ograniczeniami kontekstowymi współczesnych modeli.