Naukowcy zaproponowali INSPIRE - metodę treningu AI do głębszego zrozumienia matematyki przez przykłady, zamiast tylko zapamiętywania wzorców odpowiedzi. Aktualne duże modele językowe (LLM) są optymalizowane głównie pod kątem poprawnej odpowiedzi końcowej, co nie mówi nic o tym, czy model naprawdę rozumie matematyczne koncepcje czy je tylko memoryzuje.

Inspirowana sposobem edukacji matematycznej u ludzi, nowa metoda nazwana INSPIRE połączyła dwa elementy. Po pierwsze, Reference-Guided Student Internalization (RGSI) produkuje wysokiej jakości pary preferencji do treningu, pracując w ramach możliwości samego modelu - to imituje sposób, w jaki nauczyciele konstruują kontrprzykłady testujące granice twierdzeń. Po drugie, scenariusz treningowy z preferencjami rozłożony na etapy najpierw uczy model przyjąć tę strategię rozumowania, a dopiero potem uczy go poprawiać poprawność odpowiedzi. Wyzwania były realne: model musi najpierw nauczyć się konstruować sensowne przykłady, zanim będzie potrafił je prawidłowo zastosować.

Eksperymenty na modelach różnych rozmiarów i z różnych rodzin wykazały konsekwentne ulepszenia, z rezultatami konkurującymi z większymi modelami open-source. Kluczowe: testy na benchmarkach poza rozkładem danych treningowych potwierdziły, że model nie stracił zdolności do ogólnego matematycznego rozumowania, co oznacza że poprawa nie pochodzi z wąskiego przetrenowania na konkretnym problemie.