Naukowcy zidentyfikowali poważny problem w multimodalnych modelach języka: systemy generują mniej dokładne odpowiedzi, gdy otrzymują do przetwarzania obrazy zamiast tekstu, nawet jeśli oba wejścia zawierają semantycznie identyczne informacje. Ta dysproporcja, nazwana modality gap, nie była dotąd systematycznie mierzona ani charakteryzowana.
Team opracował TokenSwap, metodę benchmarkowania, która przekształca istniejące zestawy testowe oparte na tekście (takie jak MMLU) w wersje z przeplatanym obrazami. Zamiast podawać modelowi osobno tekst lub obraz, TokenSwap zastępuje tekstowe koncepty odpowiednimi obrazami, tworząc sekwencje z przeplatanymi tokenami wizualnymi i tekstowymi. Testy na 42 modelach multimodalnych ujawniły wszechobecną przepaść: wydajność spada średnio o 19,6% procent przy przejściu z czystego tekstu do danych zawierających obrazy, z zakresem od 4,2% do nawet 47,4% u różnych modeli.
Interesujące obserwacje pokazują, że modele rozumowania (jak o1) radzą sobie znacznie lepiej, osiągając średni spadek zaledwie 10,1%, podczas gdy standardowe modele tracą 25,5%. Zwykłe strategie promptingu czy zwiększanie mocy obliczeniowej nie rozwiązują problemu. Jednak integracja TokenSwap podczas trenowania modeli skutecznie zmniejsza tę lukę, jednocześnie utrzymując wysoką wydajność na czystych tekstach i zadaniach widzenia-języka.