Naukowcy ze studiów nad modelami językowymi ujawnili kluczowy problem: LLM-y używane jako sędziowie do oceniania prac wykazują stronniczość na podstawie samych etykiet "swoich" i "cudzych", niezależnie od faktycznej jakości. W eksperymencie dziesięć różnych modeli oceniało wybory narracyjne - zadania bez specyficznych cech każdego modelu - zamiast tradycyjnie ocenianego tekstu generowanego.
W warunkach ślepych testów, gdzie nie znane były modele, samolubna preferencja largely znikała po kontroli jakości. Jednak gdy etykiety mówiły "to moja praca" lub "to czyjąś innego", nawet bez nazwy konkretnego modelu, oceny drastycznie się zmieniały. Modele zawyżały oceny dla prac oznaczonych jako własne i zaniżały dla cudzych, niezależnie od rzeczywistego źródła. Ten efekt wskazuje, że etykieta autorstwa sama w sobie zmienia sposób oceniania.
Badacze podkreślają, że odkrycie to ma ważne implikacje dla coraz powszechniejszych systemów LLM-as-a-judge. Jeśli modele oceniające reagują na etykiety niezwiązane z faktyczną zawartością, wtedy niezawodność automatycznych ocen AI może być znacznie mniejsza niż sądziliśmy. Otwarte zadania bez wiadomo jaka odpowiedź mogą być lepszym narzędziem do testowania prawdziwych błędów sędziów AI.