Naukowcy z Carnegie Mellon i Stanford opublikowali PsyAgentBench, benchmark dedykowany separacji pomiędzy rzeczywistymi uprzedzeniami w modelach językowych a zwykłym naśladowaniem ludzkopodobnych wzorców odpowiedzi. Zespół ponownie przeprowadził pięć klasycznych eksperymentów psychologicznych na otwartych modelach, stosując plan faktorialny z czterema zmiennymi - każdy test był uruchomiony z jawnym oznaczeniem paradygmatu i bez niego, zarówno w wersji podręcznikowej jak i wariancie zmodyfikowanym, aby zmniejszyć zbieżność z danymi treningowymi.

Wyniki pokazują, że pozorne ludzkie błędy poznawcze w modelach pojawiają się poprzez jakościowo różne mechanizmy. W konformizmie Ascha - modelach brakowało prawie całkowicie efektu w wersji ślepej, ale przy jawnym nazwaniu paradygmatu 83,3 procent większych modeli podążało za grupową odpowiedzią. W zakotwiczeniu znaleziono efekt racjonalny: model idealnie polegał na zakotwiczeniu przy wymyślonych liczbach, ale dokładnie zero procent przy faktach dających się zweryfikować. Niektóre efekty były całkowicie nieobecne - chociażby koszt utopiony - podczas gdy inne wynikały z mechanizmów bezpieczeństwa, gdzie sama odmowa była pierwotnym zjawiskiem.

Badanie ma znaczące implikacje dla rozumienia, czy modele językowe rzeczywiście posiadają uprzedzenia podobne do ludzkich, czy też jedynie odzwierciedlają wzorce z danych treningowych i instrukcji. Osmiesięczne testy na trzech rodzinach modeli z prawie 42 tysiącami prób sugerują, że obserwowane efekty są głównie artefaktami veritasu - kontaminacji danych treningowych i mechanizmów sterowniczych, a nie głębokim defektem poznawczym.