Zespół badawczy wprowadził nową metodę ewaluacji o nazwie SWORD (Systematic Wikidata-based Object-Relation Distortion), która testuje zdolność dużych modeli językowych do konsekwentnego odrzucania nieprawdziwych stwierdzeń w ośmiu szeroko używanych językach. Benchmark generuje syntaktycznie poprawne, ale faktycznie błędne zdania poprzez kontrolowane zaburzenia trójek danych Wikidaty, od losowych podstawień entitów aż po semantycznie wiarygodne zamianę właściwości.
Badania ujawniły dwa kluczowe odkrycia całkowicie pomijane przez konwencjonalne benchmarki. Po pierwsze, modele paradoksalnie osiągają wyższą dokładność na semantycznie wiarygodnych zniekształceniach niż na absurdalnych losowych podstawieniach. To sugeruje, że modele nie weryfikują faktów w głębokim sensie, lecz polegają na znajomości tego, co frecjencyjnie pojawia się w danych treningowych. Po drugie, analiza wielojęzykowa ujawniła znaczące luki w wydajności - języki azjatyckie, takie jak chiński czy japoński, wykazują spadek wydajności nawet do 28 punktów procentowych w stosunku do języków europejskich, mimo że modele wykazują porównywalne wyniki na testach podstawowych. Te asymetryczne możliwości wielojęzycznego rozumowania są całkowicie maskowane przez zagregowane metryki dokładności, co podważa wiarygodność dotychczasowych ocen wielojęzyczności współczesnych LLM.