Naukowcy z arXiv opublikowali EPOCH, nową architekturę dla agentów AI, która zmienia sposób prowadzenia odkryć naukowych w matematyce i informatyce. Problem, który rozwiązuje EPOCH, jest fundamentalny: istniejące systemy zoptymalizowane do maksymalizacji feedbacku od ewaluatora zbyt łatwo promują obiecujące, ale kruche kandydaty jako odkrycia, mylą benchmarkowe улучszения z rzeczywistymi twierdzeniami, a certificate i lemat-level claims są rozmyślnie pamiętane bez odpowiedniej kontroli.

EPOCH wprowadza nową metodologię poprzez cztery kluczowe komponenty: jawne kontrakty opisujące, co każde zadanie wymaga; typy pamięci segregujące różne rodzaje wyników; aktywne falsyfikowanie, które celowo szuka kontrprzykładów; i niezależne powtarzanie testów, które weryfikuje czy wynik się replikuje. Każdy kandydat jest oceniany nie tylko na podstawie metryki, ale na podstawie siły i zakresu vědeckego twierdzenia, które wspiera. To podejście drastycznie zmienia równowagę - zamiast promować statystyczne artefakty, EPOCH skupia się na rzeczywistych postępach.

Wyniki są imponujące: EPOCH osiągnął średni znormalizowany wynik 0.65 na AlgoTune, znacznie przewyższając dotychczasowy rekord 0.53, i wynik 0.57 w wewnętrznym zestawie testów Math14. Zaletą jest też stabilne zachowanie w testach offline i liderowanie w agregacie AgentHPO. Wśród dziesięciu problemów eksploracji EPOCH dostarczył konkretne postępy: ulepszone algorytmy, nowe kontrprzykłady i wyniki wspierane dowodami. To pokazuje, że rygorystyczna kontrola nad przebiegiem odkrywania nie hamuje postępu, ale go przyspiesza i czyni wiarygodnym.