Naukowcy opublikowali metodę Middle-layer Attention Prediction (MAP) do optymalizacji przetwarzania wizualnych tokenów w multimodalnych modelach językowych. Problem polega na tym, że modele MLLM przetwarzają wiele tokenów wizualnych, co generuje znaczne koszty obliczeniowe, chociaż nie wszystkie tokeny są równie ważne dla danego zadania.

Istniejące podejścia do przycinania tokenów wizualnych opierają się na uwadze tekst-wizja z warstw środkowych modelu. Jednak analiza autorów pokazuje dwa istotne problemy: po pierwsze, optymalna warstwa, której uwaga najlepiej prowadzi selekcję tokenów, zmienia się w zależności od próbki - używanie stałej warstwy jest więc suboptymalne. Po drugie, aby pobrać uwagę z odpowiedniej warstwy, trzeba już przetworzyć wiele tokenów wizualnych przez kilka warstw modelu, co pochłania znaczną moc obliczeniową.

Metoda MAP rozwiązuje oba problemy za pomocą Question Contrastive Teacher Selection - techniki, która wybiera optymalną warstwę nauczycielską dla każdego wejścia, porównując uwagę dla pierwotnego pytania i pytania referencyjnego. Następnie uwaga z wybranej warstwy jest destylowana do lekkiego predyktora, który szacuje ważność tokenów wizualnych na podstawie cech multimodalnych. Podczas wnioskowania MAP łączy przewidywane wyniki ważności z kryterium różnorodności, aby przyciąć tokeny wizualne zanim przejdą przez pierwszą warstwę modelu językowego.