Naukowcy z arXiv CS.CL sprawdzili, czy niedrogie otwarte modele można wykorzystać do automatycznej oceny dowodów matematycznych z taką samą niezawodnością co kosztowne modele frontier. W eksperymencie na 200-instancyjnym zbiorze walidacyjnym IMO-GradingBench trzej tacy sędziowie - GPT-OSS 120B, DeepSeek-V4 Flash oraz Gemma-4 31B - osiągnęli zgodność z ludzkimi ocenami (pass/fail) na poziomie statystycznie nierozróżnialnym od Claude Opus 4.7 i Gemini 3.1 Pro, przy kosztach niższych o dwa rzędy wielkości.

Rezultaty okazały się zaskakujące dla samych badaczy. Wstępnie spodziewali się, że głosowanie większościowe trzech tanich modeli będzie optymalnym rozwiązaniem budżetowym, ale w praktyce najlepszy z nich osiągnął porównywalne wyniki sam. Jednak rozszerzając analizę na pełny benchmark z 1000 instancji i eksperymentując z regułami konsensusu, odkryli, że wymóg jednomyślnej zgody wszystkich trzech modeli (all-three-pass) dał najwyższą precyzję i najmniejszą zmienność między niezależnymi uruchomieniami.

Główny wniosek to że tanie sędziowie są konkurencyjni wobec modeli premium przy koszcie jeden do dwóch rzędów wielkości niższym. Zespół rekomenduje regułę all-three-pass jako praktyczne wdrożenie, z zastrzeżeniem że została ona zidentyfikowana post-hoc i powinna być niezależnie zweryfikowana w kolejnych badaniach. To ma istotne implikacje dla oceniania zaawansowanych systemów rozumowania matematycznego.