Zespół badaczy opracował uogólniony model fundamentalny zdolny do pracy z arbitralnymi kombinacjami modalności i dowolnymi zadaniami predykcyjnymi, co stanowi znaczący krok naprzód w elastyczności sztucznej inteligencji. Dotychczasowe modele fuzji multimodalnej były sztywne - raz wdrożone potrafiły obsługiwać tylko z góry określone modalności (wizję, tekst, audio) i pojedyncze zadania, wymagając ponownego trenowania dla nowych aplikacji.

Klucz do rozwiązania leży w kodowaniu transferowalnych wzorców korelacji między modalności zamiast uzależniania modelu od konkretnych typów danych. Badacze wytrenowali model na syntetycznych zbiorach danych o dużej skali z zróżnicowanymi strukturami przyczynowymi, które realistycznie reprezentują procesy generatywne prawdziwych danych multimodalnych. Podczas wnioskowania model aktywuje odpowiednie asocjacje przez przykłady in-context.

Ekstensywne testy na 18 rzeczywistych zbiorach danych obejmujących 12 modalności i 11 zadań predykcyjnych wykazały konkurencyjną wydajność modelu. To osiągnięcie ma potencjał революционизować zastosowania praktyczne - od medycyny przez robotykę do autonomicznych systemów, gdzie dane pochodzą z wielu źródeł jednocześnie i wymagają szybkiego dostosowania do nowych scenariuszy.