Zespół badawczy odkrył, że dane z ludzkiej informacji zwrotnej używane do trenowania modeli przez RLHF mogą zawierać błędy wynikające z psychicznego stanu annotatorów. Podczas gdy etykiety preferencji mają odzwierciedlać jakość porównywanych odpowiedzi, mogą faktycznie odzwierciedlać zmęczenie, stres lub złe samopoczucie osoby wykonującej adnotacje w danym momencie.

To odkrycie znacząco różni się od zwykłych nieporozumień między annotatorami lub losowych błędów. Obciążenie stanu anotatora ma charakter systematyczny - kiedy wielu pracowników pracuje w trudnych warunkach, ich preferencje mogą się zmieniać w podobny sposób, co prowadzi do skoordynowanego błędu w zbiorze danych. Ten błąd następnie propaguje się przez modele nagród i optymalizację polityki, potencjalnie distorsjonując ostateczne zachowanie wytrenowanego modelu.

Badacze opracowali szczegółowy framework audytu z pięcioma falsyfikowalnymi przewidywaniami i progami wielkości efektu. Zaproponowali metodologię opartą na metrykach leksykalnych, pragmatycznych i dyskursywnych do pomiaru autentyczności emocjonalnej raterów. Ich framework może być zastosowany do publicznie dostępnych modeli i potencjalnie zmieni sposób, w jaki firmy monitorują jakość danych treningowych, zwracając uwagę nie tylko na niezgodę między annotatorami, ale także na systematyczne wzorce związane z ich samopoczuciem.