Badacze z arXiv opublikowali pracę dotyczącą fundamentalnego problemu z chain-of-thought w modelach AI: pisane przez nich uzasadnienia mogą wcale nie być faktyczną przyczyną ich odpowiedzi. Zamiast tradycyjnych testów polegających na edytowaniu tekstu i obserwacji wyniku, naukowcy dokonywali zmian bezpośrednio na poziomie aktywacji neuronów w modelu Qwen3-4B, używając syntetycznych zadań wieloetapowych.

Wyniki były zaskakujące. Na najizbardziej czułej warstwie sieci, tylko 76,9% procent samowygenerowanych kroków rozumowania okazało się kauzalnie obciążające - czyli rzeczywiście warunkujące odpowiedź modelu. To znacznie mniej niż sugeruje tradycyjny test behawioralny, który wykazał 88,2% procent. Luka 11,4 punktu procentowego pokazuje, że obecne benchmarki oszacowują wiarygodność uzasadnień modeli. Dla łatwiejszych zadań przeszacowanie sięgało nawet 20 punktów procentowych. Mniejszy model Qwen3-1.7B wypadł jeszcze gorzej z kauzalną lojalnością na poziomie zaledwie 54,8%.

Badanie ma istotne implikacje dla zaufania do AI: jeśli modele podają wyjaśnienia, które nie są faktyczną przyczyną ich decyzji, to poleganie na ich reasoning może być mylące. Zaproponowana metodologia zmian na poziomie aktywacji otwiera nowe możliwości diagnozowania rzeczywistych procesów myślowych sieci neuronowych, zamiast opierania się tylko na obserwacji wyjść tekstowych.