Naukowcy opracowali ramy teoretyczne do badania zjawiska zwanego retorycznym misalignmentem, gdzie modele językowe prezentują informacje w sposób, który skłania ludzi do podejmowania gorszych decyzji niż gdyby oceniali same fakty. Przeprowadzili eksperyment z lekarzami, którzy odpowiadali na pytania z egzaminu American Medical Licensing Examination. Wyniki pokazały, że informacje wygenerowane przez LLM-y doprowadziły do średnio 2,81% szkodliwych zmian decyzji - lekarze zmienili prawidłowe odpowiedzi na nieprawidłowe.

Analizując wyjaśnienia uczestników, zespół odkrył, że modele AI aktywowały klasyczne bias poznawcze poprzez język: efekt zakotwiczenia, bias autorytetu (ludzie bardziej wierzą autorytetom) i aversionę strat. To oznacza, że problem nie zawsze leży w samych informacjach, ale w sposobie ich podania - jak LLM komponuje zdania, jakie argumenty stawia na pierwszy plan, czy jaki ton przyjmuje.

Badanie ma znaczenie dla całego ekosystemu medycyny gdzie AI zaczyna wspomagać diagnostykę i decyzje kliniczne. Jeśli model jest faktycznie trafinym, ale jego prezentacja wyniki jest mylące, może prowadzić do złych wyborów choć dane były właściwe. Zespół opracował też sposób na skalowalne testowanie tego problemu używając symulowanych decydentów - samych LLM-ów - aby szybko identyfikować modele podatne na retoryczny misalignment.