StochBench to nowy benchmark zawierający 450 problemów z zakresu procesów stochastycznych w systemie Lean 4, każdy połączony z naturalnojęzykowym opisem źródła. Benchmark powstał w odpowiedzi na brak reprezentacji procesów stochastycznych w istniejących benchmarkach dla automatycznego dowodzenia twierdzeń, które dotąd skupiały się głównie na problemach z olimpiad matematycznych takich jak IMO i Putnam.

Problemy w StochBench dotyczą szerokiego spektrum zagadnień zaawansowanej matematyki: od podstawowych łańcuchów Markowa przez procesy odnowienia i błądzenia losowe, aż po złożone koncepcje takie jak martyngały, czasy zatrzymania, procesy Poissona, ruchy Browna i rachunek stochastyczny. Zestaw problemów obejmuje różne poziomy abstrakcji, co czyni go bardziej realistycznym reprezentantem rzeczywistych zastosowań matematyki.

Agent oparty na modelu Opus 4.8 osiągnął 34,9% wskaźnik powodzenia w dowodzeniu (157 z 450 problemów) w limicie czasu 15 minut na problem. Wynik pokazuje, że mimo postępów w automatycznym dowodzeniu twierdzeń, dziedzina matematyki stosowanej pozostaje wyzwaniem dla współczesnych modeli. StochBench jest ważny dla całej społeczności AI, ponieważ pozwala na bardziej precyzyjną ocenę zdolności modeli do pracy z zaawansowaną matematyką poza tradycyjnymi konkurencyjnymi zbiorami problemów, jednocześnie podając właściwe kierunki dla przyszłych ulepszeń.