Naukowcy z arXiv zaproponowali nowy benchmark do oceny zdolności modeli AI w rozumieniu pragmatyki społecznej chińskich komentarzy internetowych. Zadanie polega na odgadnięciu rzeczywistego znaczenia wypowiedzi pośredniej lub żartobliwej na podstawie kontekstu wymiany. Z ogromnej bazy 200 tys. publicznych interakcji w mediach społecznościowych wyekstrahowano 4735 walidowanych elementów testowych, każdy zawierający komentarz docelowy, rekonstruowany poprzedni kontekst i kilka wiarygodnych błędnych interpretacji.
Testowanie ośmiu modeli AI wykazało, że zadanie jest istotnie trudne. Najlepszy model osiągnął dokładność 81,42% w wariancie leave-writer-out, podczas gdy średnia dla wszystkich ośmiu LLM-ów wyniosła 68,70%. Dla porównania ludzie uzyskali 90,8% dokładności. Ta luka wskazuje na fundamentalne słabości w zdolności obecnych modeli do zrozumienia społecznego kontekstu i zamiarów stojących za słowami.
Analiza przypadków ujawniła ciekawy wzór: modele zazwyczaj potrafią rozpoznać, że komentarz zawiera irację lub żart, ale nie potrafią prawidłowo zidentyfikować konkretnego mechanizmu czy intencji interakcyjnej. To sugeruje, że podczas gdy AI nauczyło się dostrzegać szersze zjawiska pragmatyczne, brakuje mu subtelnego rozumienia dynamiki konwersacji i niejawnych znaczeń charakterystycznych dla naturalnego komunikowania online. Benchmark stanowi cenny narzędzie do mierzenia postępu w tym kierunku.