Naukowcy opracowali nowatorską metodę równoważenia wkładu poszczególnych modalności w modelach multimodalnych poprzez zmianę sposobu reprezentacji etykiet. Problem, który rozwiązują, dotyczy faktu, że przy jednoczesnym uczeniu się z tekstu, obrazów i audio, jeden typ danych często dominuje nad innymi, co prowadzi do gorszych wyników całego systemu. Zamiast tradycyjnego podejścia, gdzie wszystkie modalności mają jednakowy wpływ, badacze zaproponowali inteligentne przekształcenie przestrzeni etykiet - czyli sposób, w jaki model interpretuje poprawne odpowiedzi.

Istota ich rozwiązania leży w dostosowaniu reprezentacji danych treningowych tak, aby każda modalność - tekst, obraz czy audio - mogła wnieść równomiernie do nauki modelu. Dotychczasowe systemy multimodalne często borykały się z tym, że jedna modalność pochłaniała większość siły obliczeniowej podczas treningu, a inne były niedoreprezentowane. To szczególnie istotne w praktycznych zastosowaniach, gdzie równoległa analiza wielu typów danych jest kluczowa - od rozpoznawania scen w wideo, przez analizę dokumentów zawierających tekst i zdjęcia, po systemy dialogowe łączące mowę i tekst.

Dzięki nowej technice modele mogą osiągnąć lepszą synchronizację między modalościami i wyższą ogólną wydajność. To oznacza, że systemy będą bardziej niezawodne i dokładne, niezależnie od tego, z jakiego typu danych pochodzą dane wejściowe. Takie równoważenie może mieć duży wpływ na rzeczywiste zastosowania sztucznej inteligencji, gdzie dane multimodalne są regułą, a nie wyjątkiem.