Kontaminacja danych w benchmarkach matematycznych staje się poważnym problemem przy ewaluacji dużych modeli językowych, bo modele mogą się uczyć z zestawów treningowych zawierających elementy benchmarków. RePro to pierwszy framework integrujący neural automated theorem provers zorientowane na Lean z procesem przebudowy benchmarków, zapewniający stopercentową weryfikację poprawności nowych zadań i odpowiedzi.
Ramówka działa poprzez automatyczną przebudowę problemów matematycznych i regenerowanie odpowiedzi, przy czym każde rozwiązanie jest formalnie zweryfikowane za pomocą proof-checkerów Lean. To oznacza, że zadania nie mają błędów logicznych ani niedodefiniowanych warunków - zjawisko, które plaguje istniejące metody rewritingu. Testy na zbiorach GSM8K i MATH wykazały, że podejście RePro utrzymuje zadania z 100% well-definedness, feasibility i answer correctness.
Wyniki są zaskakujące: kilka spotykanych w praktyce modeli LLM wykazało znaczny spadek dokładności na przebudowanych benchmarkach, co sugeruje, że część ich wydajności może wynikać ze społu memoryzacji lub wrażliwości na warianty powierzchniowe zadań. Odkrycie to podważa dotychczasowe oceny wiarygodności tych modeli w rzeczywistych zadaniach matematycznych i podkreśla znaczenie takich proof-verified benchmarków dla uczciwej ewaluacji.