Badacze zbadali 1081 pull requestów z bazy Terminal-Bench 3 / Frontier-Bench 0.1 zawierającej 639 zadań i 28801 prób ze spendiniem $105933, aby dowiedzieć się co certyfikuje zadanie, które nie rozwiązał żaden model. Okazało się, że sama zerowa stopa rozwiązań nie gwarantuje trudności - może ona wynikać z rzeczywistej luki w możliwościach, ale też z brakującego kontekstu, uszkodzonej funkcji weryfikacyjnej, błędów infrastruktury lub możliwości obejścia weryfikatora.
Spośród 125 zadań z brakiem udanych rozwiązań tylko 78 przetrwało rygorystyczną weryfikację jako certyfikowane niezrozwiązane zadania. Pozostałe 47 miało problemy: 14 miało uszkodzone mechanizmy sprawdzania wyników, 8 było zdominowanych przez błędy infrastruktury, 4 mogły być rozwiązane tylko przez obejście weryfikatora, a 21 nie miało wystarczających dowodów na potwierdzenie czy są rzeczywiście niemożliwe do rozwiązania.
Wnioski z badania są ważne dla jakości benchmarków. Brak saturacji (wszyscy agenci nie rozwiązali) to nie to samo co rzeczywista trudność. Etykieta certyfikowanego niezrozwiąlanego zadania ma wąskie znaczenie - oznacza tylko że autorska ścieżka rozwiązania zadziałała, infrastruktura nie była problemem, nie stwierdzono prostych obejść i wszyscy testowani agenci nie rozwiązali zadania. Nie potwierdza to jednak rzeczywistej trudności, wyczerpującości weryfikatora ani braku zdolności u agentów do rozwiązania zamierzonego problemu.