Naukowcy opracowali CAT-GS - metodę optymalizacji działającą na poziomie dynamiki neuronowych podczas treningu sieci przetwarzających wiele rodzajów danych jednocześnie. Problem polega na tym, że podczas łączenia informacji ze źródeł audio, wizualnych czy tekstowych pojawiają się trzy powiązane problemy: jedna modalność może zdominować obliczenia, wybór aktywnych kanałów staje się chaotyczny a gradienty różnych źródeł kolidują przy łączeniu wyników.

Proponowana metoda CAT-GS pracuje bez modyfikacji samej sieci neuronowej - działa tylko podczas propagacji błędów wstecz. Kalibruje ufność każdej modalności poprzez skalowanie temperatury i wygładzanie exponential moving average, a następnie inteligentnie przełącza między trzema strategiami: podgrzewaniem określonych gałęzi, priorytetem dla słabszych modalności oraz wyważonym mieszaniem. Jednocześnie ogranicza rozbieżności w magnitudach gradientów oraz redukuje destructive interference między modalościami używając specjalnego wariantu PCGrad.

Testowanie obejmowało popularne benchmark-i audio-wizualne jak CREMA-D, AV-MNIST i VGGSound, a także dane trzymodalne z UR-FUNNY, syntetyczne dane CG-MNIST oraz cross-domain testy AVE i CMU-MOSI. Wyniki pokazują poprawę lub wyrównanie wydajności w stosunku do istniejących metod fuzji multimodalnej, co czyni CAT-GS praktycznym rozwiązaniem dla aplikacji wykorzystujących wiele źródeł informacji jednocześnie.