Naukowcy z arXiv przeprowadzili kompleksową ocenę tego, jak dobrze siedem modeli LLM rozumie emocjonalne ramy narracyjne w nagłówkach dotyczących konfliktów. Badanie porównało odpowiedzi modeli AI z oceną 3011 uczestników badania YouGov, stanowiących reprezentatywną próbę dorosłej populacji Wielkiej Brytanii, którzy odpowiadali, czy nagłówki wzbudzały w nich sympatię do którejś ze stron konfliktu.
Wyniki pokazały znaczne zróżnicowanie między modelami w zdolności do wyrównania się z ludzkimi emocjami. GPT-5.2 osiągnęła najwyższą korelację na poziomie 0,789, podczas gdy Mistral Large 2512 uzyskała tylko 0,4, co wskazuje na zróżnicowany stopień zrozumienia emocjonalnych niuansów. Badanie przeanalizowało również, jak wyrównanie różni się między grupami demograficznymi - badacze sprawdzali zgodność modelowych ocen z osądami uczestników z różnym wiekiem, płcią, poziomem edukacji, wcześniejszą wiedzą geopolityczną oraz postawami wobec konfliktów.
Osiągnięcia wiodących modeli są obiecujące - wykazują szerokie wyrównanie z ludzką percepcją emocjonalną across all demographic subgroups. Jednocześnie badanie podkreśla ważne, często ignorowane aspekt problemu: mimo wysokiej ogólnej wydajności, wyrównanie AI nie jest uniwersalne. Nawet gdy modele radzi sobie dobrze średnio, mogą wykazywać różne stopnie porozumienia z różnymi populacjami demograficznymi. To odkrycie ma znaczenie dla rozwoju bardziej uczciwie ukalibrowanych systemów AI, które powinny brać pod uwagę nie tylko ogólną wydajność, ale też konsystencję zrozumienia między różnymi grupami użytkowników.