Zespół badawczy wprowadził TestHallVQA, benchmark do oceny wielomodalnych modeli sztucznej inteligencji w zadaniach visual question answering (VQA) na dokumentach naukowych. Benchmark łączy dwa dotychczas rozdzielne wyzwania: rozumienie długich dokumentów oraz złożone rozumowanie wizyjne, jednocześnie symulując rzeczywisty scenariusz - pytania z egzaminów ze zbędnymi informacjami na stronach.
Głównym odkryciem badaczy jest usystematyzowana analiza wpływu nieistotnych żetonów wizyjnych na wydajność modeli. Chociaż intuicyjnie wiadomo, że zbędne informacje mogą zaburzać LVLMs, ten efekt nigdy nie był formalnie kwantyfikowany. TestHallVQA pozwala na kontrolowane wprowadzanie redundancji na wielu poziomach, imitując rzeczywiste warunki czytania dokumentów akademickich.
Badacze zaproponowali nową metrykę F1-R², która jednocześnie mierzy zdolność modeli do rozumowania oraz odporność na redundancyjne konteksty. Szeroki eksperyment na mainstream'owych LVLM-ach ujawnił luki w ich zdolnościach rozumowania na poziomie dokumentów. Cały kod, dane i teoretyczne analizy są dostępne na GitHubie, co otwiera drogę dla dalszych badań nad bardziej niezawodnymi modelami wizyjno-językowymi.