Naukowcy badali, czy dużych modele językowych faktycznie rozumieją finansowe rozumowanie czy tylko pasują się do wzorców w danych treningowych. Do tego celu stworzyli nowy benchmark FinIndices, który testuje modele na całych, niecropowanych sprawozdaniach finansowych o długości aż 32 tysięcy tokenów - znacznie bliżej rzeczywistości промышленnej niż istniejące benchmarki oparte na pytaniach wielokrotnego wyboru.
Wyniki ujawniły dwie poważne problemy. Po pierwsze, modele wykazują się tym, co badacze nazwali Knowledge Bottleneck: mimo że podczas treningu zapamiętują wzory finansowe, ich "rozumienie" jest powierzchowne. Gdy badacze usunęli eksplicytne podpowiedzi dotyczące wzorów, wydajność spadła spektakularnie - na przykład Gemini-3.1-Pro spadł z 70,70 procent do zaledwie 38,22 procent na zadaniach tabelarycznych. To pokazuje, że modele nie potrafią naprawdę stosować logiki finansowej, tylko odtwarzają zapamiętane wzory.
Druga słabość to Structural Bottleneck: złożoność generowania tabel z wieloma metrykami i okresami czasowymi jednocześnie przeciąża zdolności rozumowania modeli. Modele, które bezbłędnie działają na izolowanych obliczeniach, rozpadają się pod presją strukturalną złożonych zadań. To ma znaczące implikacje dla zastosowania LLM w finansach, gdzie dokładne wieloetapowe wnioskowanie jest kluczowe.