Zespół badawczy opracował EMODE, model języka dla mowy, który znacznie lepiej rozumie i zachowuje emocje podczas przetwarzania audio. Problem stanowiła dotychczasowa zależność dużych modeli mowy od splątanych reprezentacji akustycznych, które sprawiały, że systemy przesadnie polegały na odzyskiwanej zawartości słownej zamiast gruntować się w wymownych cechach akustycznych.

Rozwiązaniem jest Dynamic Para-Semantic Experts (DPSE) - architektura, która rozkłada cechy mowy na oddzielne ścieżki semantyczne i paralingwistyczne. Ścieżki te są dynamicznie kierowane, łączone, a następnie integrowane z modelem języka. Kluczowe innowacje to trójstopniowy proces treningowy obejmujący fazy przygotowania semantycznego, aktywacji paralingwistycznej i wspólnego udoskonalania, wspierany specjalistycznymi technikami: Orthogonal Expert Guidance, Semantic-to-Acoustic Alignment i Gating Diversity Regularization.

Wyniki testów na zadaniach rozpoznawania emocji (SER), oceny empatycznych odpowiedzi oraz nowo skonstruowanym dwujęzycznym benchmarku MEPA pokazują, że EMODE poprawia balans między wiernością leksykalną a wrażliwością emocjonalną. Podejście to demonstruje wartość jawnego rozmontowania elementów paralingwistycznych dla solidnego rozumienia emocji między różnymi zbiorami danych.