Badacze opracowali Multi-Modal Generative Fuzzy System (MMGFS) - architekturę łączącą klasyczne systemy rozmyte z nowoczesnymi dużymi modelami językowymi do rozwiązywania zadań wielomodalnego odpowiadania na pytania. System adresuje kluczowe problemy istniejących podejść, takie jak uprzedzenie modalności wynikające z różnic w rozkładach cech tekstowych, obrazowych i mowy.
Głównymi innowacjami MMGFS są dwa mechanizmy. Po pierwsze, mechanizm wielomodalnej wspólnej analizy (multimodal collaborative rumination) zmniejsza odchylenie modalności poprzez lepszą integrację heterogenicznych źródeł informacji. Po drugie, system wprowadza reguły rozmyte i wieloskokowy mechanizm wnioskowania (multi-hop inference), które umożliwiają fuzję wiedzy z różnych dziedzin i hierarchiczne rozumowanie. To podejście znacznie zwiększa zdolność modelowania niepewności - istotną kwestię w pytaniach wymagających wiedzy z wielu obszarów.
Architektura MMGFS oferuje większą głębię semantyczną i przejrzystość w porównaniu z tradycyjnymi podejściami opartymi na dopasowaniu semantycznym czy prompt-based frameworkach. Fuzzy inference - pochodzący z tradycji systemów rozmytych - pozwala na bardziej wiarygodne i interpretowalne podejmowanie decyzji w złożonych scenariuszach wielomodalnych, gdzie jednoznaczne odpowiedzi są rzadkie.