Zespół badaczy opracował MAR-12, nowatorski framework do analizy internet meme'ów, które zawierają zarówno elementy humoru jak i treści potencjalnie szkodliwe. System wykorzystuje Vision Language Models i analizuje każdy meme z dwunastu różnych perspektyw teoretycznych opartych na badaniach humoru i teorii nienawiści. To podejście pozwala systemowi zrozumieć skomplikowane wzajemne oddziaływania między elementami wizualnymi, tekstem i kontekstem kulturowym, które stanowią istotę interpretacji meme'ów.
Framework wykorzystuje mechanizm soft-gated attention uwzględniający role poszczególnych perspektyw, aby określić, które aspekty są najważniejsze dla danego meme'a. Po analizie system klasyfikuje meme za pomocą prototypowego klasyfikatora, a następnie генeruje wyjaśnienia łączące perspektywy rozumowania z wyliczonymi wagami uwagi. To zapewnia przejrzyste, ugruntowane w kontekście uzasadnienia dla wydawanych orzeczeń - zarówno dla algorytmów jak i dla ludzi.
Wyniki badań na zbiorach danych PrideMM i Memotion pokazują dominację MAR-12 nad istniejącymi rozwiązaniami, z dokładnością 80,3% w detekcji humoru i 75,9% w detekcji treści nienawiści. Zarówno oceny człowieka jak i analizy dokonane przez model GPT-4 potwierdzają wysoką jakość wyjaśnień generowanych przez system. Badanie ma istotne implikacje dla moderacji treści w mediach społecznościowych i rozwoju bardziej interpretacyjnych systemów multimodalnych.