Naukowcy analizując multimodalne duże modele językowe wykazali, że nieistotny tekst konsekwentnie wpływa na decyzje modelu dotyczące obrazów. W badaniu sformułowano problem jako interwencję kontrolowaną w ramach binarnego systemu oceny wizualnej - badacze zmieniali tekstowe informacje towarzyszące, utrzymując niezmienną strukturę promptu, i obserwowali, jak model reaguje na różne benchmarki.

Kluczowe odkrycie polega na tym, że wrażliwość na nieistotny kontekst ma regularną strukturę geometryczną. Naukowcy zbadali marginesy decyzji (różnice między logami prawdopodobieństwa dla dwóch możliwych odpowiedzi) i stwierdzili, że gdy dodaje się kontekst, marginesy ulegają spójnej transformacji matematycznej - można je opisać jako funkcję afiniczną ich wersji bez kontekstu. To oznacza, że wpływ nieistotnego tekstu nie jest chaotycznym szumem, ale estymowaną zniekształceniem preferencji modelu.

Wyniku tego badania wyjaśniają wrażliwość multimodalnych modeli na hałaśliwe dane i oferują podstawę do opracowania bardziej odpornych systemów. Parametry transformacji afinicznej można interpretować jako miary „zaangażowania wizualnego" i uprzedzenia kierunkowego odpowiedzi, co otwiera nowe możliwości diagnostyki na poziomie marginesów decyzji dla MLLM. Badanie podkreśla potrzebę dalszych prac nad odpornością na szumny kontekst w warunkach realnego użytkowania.