Naukowcy opublikowali badanie pokazujące, że modele językowe reprezentują na wewnętrznym poziomie uprzedzenia zawodowe dotyczące kompetencji ludzi, nawet gdy ich zewnętrzne odpowiedzi wydają się bezstronne. Zespół opracował nowy framework łączący mechanistyczną analizę modeli z ewaluacją uprzedzeń, pozwalający na śledzenie, jak cechy demograficzne wpływają na to, jaką kompetencję model przypisuje użytkownikom.

Badacze wprowadzili technikę sterowania reprezentacjami ekspertyzy użytkownika - swoisty sposób na manipulowanie wewnętrznymi ocenami modelu. Tą metodą wykazali, że te reprezentacje rzeczywiście wpływają na zachowanie modelu w praktycznych zadaniach, takich jak odpowiadanie na pytania czy ocena kandydatów do pracy. Eksperyment przeprowadzono na kilku otwartych modelach, w każdym przypadku potwierdząc wpływ takich czynników jak płeć, rasa czy status społeczno-ekonomiczny.

Znaczenie tego odkrycia leży w tym, że tradycyjne testy oceniające uprzedzenia behawioralne mogą być niewystarczające. Model może wyglądać na bezstronny w swoich wypowiedziach, podczas gdy wewnątrz koduje sterotypowe założenia o kompetencjach różnych grup. To otwiera pytanie o to, czy obecne metody ewaluacji wychwytują rzeczywisty zakres problemów z tendencyjnością w modelach AI - zwłaszcza w zastosowaniach o realnych konsekwencjach, takich jak rekrutacja czy zarządzanie zasobami ludzkimi.