Naukowcy zbadali, jak duże modele językowe radzą sobie z atakami ad hominem - argumentami kwestionującymi wiarygodność rozmówcy zamiast atakowania jego tez. W politycznych debatach tego typu ataki są powszechne i ważne, ale LLM uważają je za błędy logiczne i zawsze się przed nimi bronią, zamiast strategicznie z nich korzystać.

Tim porównał naturalne debaty z korpusu ElecDeb60to16 (zawierającego debaty prezydenckie USA) z dialogami generowanymi przez LLM. Okazało się, że ludzie stosują bogatą gamę strategii obronnych, często przeciwatakując na poziomie osobistej wiarygodności, podczas gdy modele AI sztywnie trzymają się formalnych obrон logicznych. To wynika z tego, że bezpieczeństwo fine-tuning ogranicza modele, uniemożliwiając im pełne zaangażowanie się w interakcje, gdzie oszczerstwa na osobę to naturalna część dyskursu.

Wyniki pokazują istotną lukę między tym, jak LLM działają w debatach a tym, jak zachowują się ludzie. Badanie podkreśla, że obecne ograniczenia bezpieczeństwa modelów mogą je uniemożliwić pełne uczestnictwo w realistycznych dyskusjach politycznych, gdzie ethos rywalizuje z faktyczną zawartością argumentów.