Powszechnie przyjmuje się, że gdy wiele modeli LLM zgadza się na ocenę, jest to mocny dowód na poprawność tej oceny. Jednak wyniki nowego badania z arXiv pokazują, że założenie to ignoruje kluczowy problem: modele uczą się z podobnych danych i oceniają w podobne sposoby, przez co popełniają identyczne błędy. Naukowcy analizowali dziesięć zaawansowanych sędziów LLM z różnych dostawców i odkryli, że średnia korelacja błędów między parami wyniosła 0,21, co jest istotnym poziomu. Ta zależność oznacza, że dziesięć modelowych sędziów dostarcza tylko tyle informacji statystycznej co około 3,5 niezależnych sędziów - mniej niż połowa oczekiwanego wkładu.

Problem jest jeszcze bardziej wyraźny wśród frontierowych modelów z wysoką dokładnością. Podczas ewaluacji porównywania systemów AI zgoda między sędziami może prowadzić do błędnych wniosków: w aż 28% zbadanych porównań ignorowanie wspólnych błędów prowadziło do fałszywego wniosku, że jeden system jest znacznie lepszy od drugiego. Badacze zauważyli też, że rodzaj błędów ma znaczenie - błędy dzielone przez większość sędziów działają inaczej na consensus niż błędy skoncentrowane w mniejszej grupie.

Ta obserwacja ma daleko idące konsekwencje dla benchmarkingu AI. Naukowcy proponują proste rozwiązanie: wykorzystać mały zestaw zaufanych przykładów do estymacji dokładności sędziów i zidentyfikowania wspólnych pomyłek, a następnie uwzględnić je przy wyborze metody głosowania. Sugeruje to, że przyszłe ewaluacje powinny być bardziej świadome struktury błędów między modelami oceniającymi, zamiast naiwnie polegać na prostym consensus.