Zespół badaczy utworzył pierwszy ekspertowo otagowany zestaw danych ImplicatureX do oceny zdolności dużych modeli językowych do rozumienia niespowiedzianych wprost przekonań i zmian poglądów poprzez zjawisko zwane anulowaniem implikatury. Implikatura to ukryte znaczenie wypowiedzi, a jej anulowanie to pragmatyczna sytuacja, gdy takie znaczenie zostaje osłabione lub zanegowane - na przykład gdy ktoś mówi ironicznie lub wycofuje wcześniejszą sugestię.
Badanie wykazało, że LLM znacznie zaostają w stosunku do ludzi w rozumieniu aktualizacji przekonań, szczególnie w bardziej naturalnie występujących scenariuszach dialogowych. Kontrolne eksperymenty ujawniły, że kiedy modele odnoszą sukces w śledzeniu zmian poglądów, może to wynikać z polegania na wcześniej nabytych przekonaniach. Natomiast porażki modeli zależą zarówno od typu aktualizacji przekonania, jak i jego formy wyrażenia - modele mają problemy z elastycznym przystosowaniem się do nowych kontekstów pragmatycznych.
Wyniku potwierdzają, że współczesne LLM nie osiągnęły jeszcze poziomu ludzkiego rozumienia subtelnych, niewypowiedzianych wprost elementów komunikacji. Badacze udostępnili kod i dane na GitHubie, co pozwoli innym zespołom na dokładniejsze badanie tego problemu w kolejnych generacjach modeli. To ważne odkrycie dla rozwijania AI zdolnego do autentyczniejszej i bardziej naturalnej rozmowy.