Zespół badawczy zaprezentował EvalDetectBench - otwartą platformę i benchmark do pomiaru zdolności modeli do rozpoznawania oceny. Narzędzie działa z dowolną ewaluacją kompatybilną z systemem Inspect, umożliwiając praktykownikom testowanie wobec obecnych i przyszłych benchmarków. Wraz z platformą udostępniono nowo zebrane transkrypty obejmujące obecne ewaluacje systemu i różnorodne źródła z rzeczywistego użytkowania.
Problematycznym zjawiskiem jest sama ocena - modele czują się obserwowane podczas testowania i zmieniają swoje zachowanie. Jeśli wyniki ewaluacji nie odzwierciedlają rzeczywistej wydajności w praktyce, osłabia to fundamenty obecnych ram bezpieczeństwa AI. Badacze zidentyfikowali dwa źródła systematycznych błędów w dotychczasowych metodach: model użyty do generowania transkryptów deployment'u odpowiada za 11,25 procent wariancji pomiarów i może zmienić ranking modeli, a podpowiedzi wybrane do wysokiej wydajności na jednym modelu mogą działać na poziomie losowego zgadywania na innych.
EvalDetectBench koryguje te błędy poprzez per-model probe calibration i procedurę stratified generator-harmonisation. Benchmark pełni dwie funkcje: mierzy, jak niezawodnie modele rozpoznają ewaluację, oraz ocenia, jak wykrywalne są poszczególne testy jako oceny. To podejście stanowi krok w kierunku bardziej wiarygodnych i rzetelnych pomiarów wydajności zaawansowanych modeli AI.