Naukowcy z arXiv opublikowali MemeCULT-1K, benchmark specjalizowany w testowaniu zdolności modeli sztucznej inteligencji do rozumienia memów charakterystycznych dla Południowej Azji. Dataset zawiera 1000 memów w trzech językach - bengalskim, angielskim i hindi - każdy z notatką dotyczącą kontekstu kulturowego i trzema objaśnieniami napisanymi przez ludzi. Dodatkowy zestaw obejmuje 54 memy w dialektach bengalskich.

Ewaluacja 13 popularnych modeli wizyjno-językowych wykazała znaczące różnice w wydajności między dwoma wariantami - testowaniem samych memów oraz wariantem z dostępem do informacji kulturowej. Gdy modele otrzymały kontekst kulturowy, jakość wyjaśnień poprawiła się konsekwentnie: metryka SBERT similarity wzrosła z 44,6 do 56,4 punktu, BLEURT z 37,3 do 42,3, a oceny eksperta na bazie LLM z 2,57 do 3,43 na skali pięciostopniowej. To pokazuje, że brak dostępu do wiedzy kulturowej to główna bariera dla modeli.

Analiza szczegółowych błędów odbiła pewne trendy. Modele zamknięte, takie jak te ze zbioru OpenAI czy Google, głównie potykały się przy identyfikacji nazwisk i kontekstowych nawiązań. Z kolei otwarte modele cierpiały na szersze luki w wiedzy o kulturze Południowej Azji. Najbardziej odporna na poprawy poprzez kontekst okazała się warstwa lingwistyczna i fonetyczna - memy oparte na grach słów czy fonetycznych nieporozumieniach stanowiły wciąż wyzwanie. Wyniki motywują dalszą pracę nad eksplicytną integracją wiedzy kulturowej w modele multimodalne, szczególnie dla mniej reprezentowanych kultur. Dataset i kod zostały udostępnione publicznie.