Zespół badawczy opracował pierwsze uniwersalne prawo skalowania, które przewiduje wydajność modeli vision-language model na podstawie mierzalnych zdolności tekstowych modelu językowego stanowiącego ich podstawę. To rozwiązuje długotrwały problem w budowaniu multimodalnych systemów AI - dotychczas nie było sposobu na racjonalny wybór odpowiedniego modelu językowego bez faktycznego wytrenowania całego systemu.

Badacze wytrenowali ponad 150 VLM-ów na 34 różnych modelach językowych pochodzących z 7 różnych rodzin modeli, aby opracować i zweryfikować swoje podejście. Zaproponowana Capability-Driven Multimodal Scaling Law wydobywa niskiego wymiaru wynik zdolności z benchmarków tekstowych poprzez analizę PCA, a następnie modeluje wydajność VLM-u jako funkcję tego wyniku. Framework uwzględnia tempo transferu dla każdego modelu oraz tempo absorpcji, które mierzy, jak efektywnie system uczy się z danych multimodalnych.

Walidacja wykazała, że prawo skalowania dokładnie ekstrapoluje zachowanie z modeli o parametrach do 8B na skalę 72B, przewiduje pełne trajektorie trenowania VLM-ów z wysoką precyzją i uogólnia się na całkowicie nieznane rodziny modeli. Analiza ujawniła też ciekawe spostrzeżenia: niektóre benchmarki tekstowe negatywnie korelują z wydajnością multimodalną, sugerując, że modele mogą optymalizować się pod testy zamiast prawdziwych zdolności. Ponadto bezkierunkowe modele językowe okazały się lepszymi fundamentami dla VLM-ów niż ich wersje dostrojone na instrukcje, ze względu na wyższą absorpcję danych.