Zespół badawczy zbadał czy nowoczesne multimodalne modele fundamentowe rozpoznają emocje poprzez wspólne dla mowy i obrazu mechanizmy neuronu czy przez oddzielne ścieżki dla każdej modalności. Analizując trzy duże modele - Gemma-4-12B-it, MiniCPM-o-4.5 i Qwen2.5-Omni-7B - naukowcy identyfikowali neurony wrażliwe na emocje (ESNs), czyli rzadkie neurony głębokich dekoderów powiązane z konkretnymi kategoriami emocji.
Wyniki pokazują zarówno neurony audio wrażliwe na emocje jak i wizualne. Co ważne - deaktywacja neuronów wizualnych osłabiała rozpoznawanie odpowiadającej im emocji z twarzy, a zwiększenie ich aktywacji poprawiało to rozpoznawanie. Neurony audiowe i wizualne odpowiadające temu samemu uczuciu pokazały podobne rozkłady warstwowe i częściowe pokrywanie się, co wskazuje na strukturalne wyrównanie między afektywnymi reprezentacjami mowy i twarzy.
Najciekawsze odkrycie: neurony identyfikowane z mowy wpływały na rozpoznawanie emocji z obrazu i odwrotnie. To dwukierunkowe przesyłanie przyczynowe między modalnościami sugeruje, że multimodalne modele fundamentowe rozwijają częściowo zbieżne reprezentacje emocji. Badanie dostarcza jednego z pierwszych analiz na poziomie aktywacji neuronów afektywnych jednostek funkcjonalnych w modelach multimodalnych.