Przegląd systematyzuje obszar wykrywania anomalii w danych wielomodalnych, który dotąd był rozproszony między różnymi domenami i kombinacjami modalności. Zamiast grupować metody według architektury, autorzy przyjmują perspektywę założeń - jak definiowana jest normalność i anomalia w ustawieniach wielomodalnych. Zidentyfikowali pięć kluczowych charakterystyk leżących u podstaw wyzwań tej dziedziny.
Pierwsza grupa metod opiera się na założeniu normalności. Tu chodzi o modelowanie regularności poprzez learning reprezentacji, wyrównywanie danych z różnych modalności oraz wzbogacanie wiedzy. Druga grupa to metody zakładające anomalie, które ostrzą granice decyzyjne poprzez injektowanie anomalii na poziomie grubozrnistym, strukturalnym i semantycznym. Podejścia te stanowią komplementarne sposoby patrzenia na ten sam problem.
Modele fundamentalne radykalnie zmieniają krajobraz tej dziedziny. Oferują skalowalne pretraining, elastyczny transfer między modalnościami i nowe zdolności reasoning. Przegląd kompiluje reprezentatywne benchmarki i protokoły ewaluacji across domains, wskazując na otwarte problemy takie jak budowanie systemów robustnych, adaptacyjnych i interpretowalnych dla wielomodalnego wykrywania anomalii.