Naukowcy na arXiv opublikowali badanie pokazujące, że multimodalne modele językowe nie traktują dowodów neutralnie - ich oceny zmieniają się w zależności od kolejności, w której otrzymują sprzeczne informacje z tekstu oraz obrazów lub mowy. W kontrolowanych eksperymentach utrzymując stałą zawartość instrukcji i dowodów, zmieniano tylko pozycje źródeł. Rezultat był konsekwentny: umieszczenie obrazu lub nagrania po sprzecznym tekście przesuwało odpowiedzi modelu w kierunku zawartości danych percepcyjnych.
Problematyka jest ważna, bo wcześniejsze badania dotyczące preferencji tekstowych wykorzystywały stały porządek dowodów lub przesuwały instrukcje zadania razem z dowodami, co uniemożliwiało jasne ustalenie wpływu kolejności. Teraz naukowcy pokazują, że to właśnie kolejność - niezależnie od preferencji modalności czy samych treści - w znaczący sposób wpływa na decyzje modeli. Zjawisko nazwane przez nich nonkommutacyjnością dowodów między modalnościami oznacza, że taki sam dowód prowadzi do różnych sądów w zależności od tego, gdzie go umieścić.
Wniosek ma szersze konsekwencje dla oceny rzeczywistych możliwości multimodalnych modeli. Dotychczasowe testy mogły zawierać ukryte błędy systematyczne wbudowane w eksperymenty - nieświadomie faworyzując niektóre modalności przez sam porządek prezentacji. Odkrycie wskazuje, że aby rzetelnie mierzyć rzeczywiste preferencje i poleganie modeli na poszczególnych źródłach, badacze muszą znacznie bardziej starannie projektować eksperymenty z uwzględnieniem efektów pozycji dowodów.