Naukowcy z ośrodków badawczych stworzyli NepOOC, pierwszy publiczny benchmark do wykrywania dezinformacji out-of-context w języku nepalskim. Zestaw danych zawiera 1090 par składających się z autentycznych zdjęć i podpisów tekstowych, z czego 545 par stanowią prawdziwe pary, a 545 to dezinformacyjne kombinacje. Każda para została zaklasyfikowana do jednej z pięciu kategorii: zmyślone treści, błędne opisy, rozbieżności czasowe, geograficzne i tożsamościowe. Anotatorzy osiągnęli wysoką zgodność z współczynnikiem kappa na poziomie 0,84.

Badacze przeprowadzili porównawczą ocenę pięciu architektur multimodalnych obok modeli analizujących wyłącznie tekst i wyłącznie obrazy. Rezultaty były zaskakujące: tekstowy model mBERT osiągnął 94,65% wyniku Macro-F1, dokładnie taki sam jak najlepszy system multimodalny łączący ResNet-50 z mBERT. Testy statystyczne (McNemar) wykazały, że różnice nie były istotne statystycznie. Natomiast modele działające tylko na obrazach uzyskały wyniki na poziomie 33-50%, ledwo lepsze niż przypadkowe zgadywanie.

Wnioski z badania wskazują, że przy obecnym rozmiarze zestawu danych semantyka tekstu jest wystarczająca do osiągnięcia wysokiej wydajności. Analiza skalowania pokazała, że ekspansja datasetu jest bardziej bezpośrednią ścieżką do poprawy wyników niż zaawansowana architektura czy specjalizacja regionalna. To ma znaczenie dla społeczności zajmującej się borą z dezinformacją w mniej zasobofilnych językach, sugerując że zamiast wydatkować zasoby na skomplikowane modele, lepiej inwestować w zbieranie większych ilości danych treningowych.