Naukowcy opracowali nową metodę klasyfikacji multimodalnej łączącej tekst, audio i obraz, która osiąga zarówno wysoką dokładność, jak i interpretowalne wyniki dla człowieka. Podczas gdy popularnie używane Transformery osiągają mocne rezultaty predykcyjne, ich rozproszone reprezentacje i głębokie nieliniowości sprawiają, że trudno przypisać znaczenie poszczególnym cechom multimodalnym, co ogranicza ich użyteczność w aplikacjach wymagających zaufania.
Proponowane rozwiązanie opiera się na zespołach drzew dyskryminacyjnych: Linear Discriminant Tree (LDT), Linear Discriminant Forest (LDF) i Linear Discriminant AdaBoost (LDAB). Framework koduje każdą modalność w tokeny, ekstrahuje i grupuje koncepty w celu zmniejszenia wymiarowości, oraz kieruje fuzjonowane modalności przez klasyfikatory oparte na zespołach drzew. Zespoły osiągają przyrosty F1-mod o 4,3 procent w stosunku do Multimodal Transformera i przyrosty dokładności o 3 procent wobec głównych bazowych rozwiązań interpretowlanych.
Nowaća tkwi w zmodyfikowanej metryce ważności cech, która zmniejsza wpływ klasy negatywnej w zadaniach klasyfikacji binarnej, co poprawia detekcję wskaźników i markerów. To podejście jest szczególnie wartościowe dla zastosowań takich jak monitoring afektu w klinice czy ocena edukacyjna, gdzie wyjaśnienie decyzji modelu jest równie ważne co sama dokładność klasyfikacji.