Naukowcy z arXiv CS.AI wprowadzili framework SHAPE do analizy tego, jak duże modele językowe podchodzą do rozumowania matematycznego na poziomie strategicznym, a nie tylko operacyjnym. Framework ten wyróżnia dwa kluczowe wymiary: semantyczne przestrzenie (różne interpretacje matematyczne tego samego problemu, np. algebraiczna czy geometryczna) oraz heurystyki (konkretne działania wykonywane w ramach tych przestrzeni, takie jak upraszczanie problemu czy rozumowanie wstecz).
Analizy przeprowadzone za pomocą SHAPE ujawniły kilka istotnych wzorców. Po pierwsze, matematyczne heurystyki stosowane przez model znacznie lepiej wyjaśniają ostateczną poprawność odpowiedzi niż tradycyjne cechy Chain-of-Thought, co sugeruje, że istnieje głębokie rozumienie działań matematycznych niezależnie od ich dosłownego wyrażenia. Po drugie, modele osiągają poprawne rozwiązania, gdy skupiają swój wysiłek wewnątrz kilku semantycznych przestrzeni zamiast rozprzestrzeniać się na wiele różnych podejść - zachowanie konsystentne z tym, jak ludzie rozwiązują problemy matematyczne.
Framework okazał się również przydatny do ewaluacji efektywności treningu. Badania wykazały, że reinforcement learning zmienia rozkład używanych heurystyk na rzecz mniejszej różnorodności podejść. Najistotniejsze jest jednak to, że post-trening promujący różnorodne heurystyki demonstrował zwiększoną dokładność modeli. SHAPE stanowi zatem teoretycznie ugruntowany narzędzie diagnostyczne do rozumienia rozumowania LLM i otwiera nowe ścieżki dla bardziej świadomych metod poprawy ich umiejętności matematycznych.