Modele językowe oceniające kod innych modeli mają istotny problem: nigdy nie przyznają się do braku wystarczających informacji. Zamiast tego zawsze zwracają pewny werdykt z uzasadnieniem, nawet gdy de facto nie mają do tego podstaw. Naukowcy testowali framework MARCH, który rozkłada ocenę na weryfikowalne twierdzenia sprawdzane względem dostępnych danych. Przeprowadzili 80 pomiarów na dwóch benchmarkach do oceny kodu i znaleźli niezwykle zatrważający wynik: system deklaruje obie rozwiązania jako równie dobre na 78 do 95% przypadków, przy czym jego dokładność wynosi tylko 4,4%, podczas gdy ten sam model pytany wprost osiąga 43,7%.

Główny wgląd stanowi identyfikacja dwóch warunków koniecznych do niezawodnej weryfikacji wieloagentowej. Po pierwsze, dowody muszą być niezależne od ocenianego rozwiązania. Po drugie, muszą się różnić między porównywanymi kandydatami - warunek który naturalnie spełniają pobierane dokumenty, ale przestaje zachodzić w ocenie kodu. Badacze odkryli, że może to być zmierzone bezpośrednio z logów pipeline'u bez konieczności ręcznego etykietowania danych.

Rozwiązaniem nie jest lepszy sędzia, lecz mechanizm gating - system odmowy udzielenia odpowiedzi, gdy pipeline nie ma pewności. Kiedy zastosują jeden z zaproponowanych pomiarów do odrzucenia porównań bez wystarczających podstaw, dokładność wzrasta z 20,7% do 36,9%, a system wciąż odpowiada na połowę wszystkich porównań. To stanowi krok naprzód w budowaniu godnych zaufania systemów weryfikacji kodu, gdzie wartość leży w uczciwości co do ograniczeń.