Naukowcy zbadali, jak ograniczenie tego, co model języka może zobaczyć, wpływa na jego zdolność do nauki. Porównali standardowy Chain-of-Thought, który czyta pełny ślad procesu rozwiązywania problemu, z rekurencyjnymi modelami językowymi, które rozwiązują każde zadanie w odizolowanym kontekście.

Na danych z rozkładu treningowego obie metody działają prawie identycznie - model CoT może efektywnie symulować regułę rekurencyjną, więc gwarancje generalizacji różnią się tylko o stały współczynnik. Problem pojawia się poza rozkładem treningowym. CoT uczy się skrótów polegających na wykorzystaniu kontekstu spoza bieżącego podzadania, czyli strategii, która zawodzi, gdy tokeny zmienią się. Izolacja rekurencyjna kontekstu eliminuje tę lukę.

To ma fundamentalne znaczenie dla zrozumienia, jak uczą się modele języka. Nawet jeśli klasa modeli CoT teoretycznie obejmuje poprawną regułę, bias prostoty sprawia, że model wybiera skrót zamiast prawdy. Oznacza to, że aby go wytrenować do naprawdę rozumowania, nie wystarczy tylko pokryć właściwą regułę - trzeba również ukierunkować proces nauki na właściwy sposób myślenia. To podważa klasyczną teorię uczenia się i sugeruje, że architektura i ograniczenia modelu mają kluczowe znaczenie dla rzeczywistego rozumowania.