Naukowcy demonstrują metodę skutecznego oddzielenia informacji lingwistycznych od paralinguistycznych w zakodowanych reprezentacjach mowy. Problem polega na tym, że self-supervised encodery takie jak SPEAR i WavLM mieszają oba rodzaje informacji w jednej, splątanej przestrzeni reprezentacji - co utrudnia kontrolę nad tym, które cechy model wykorzystuje przy wyborze decyzji. Ich rozwiązanie łączy TopK sparse autoencodera z route-specific supervision i cross-factor adversaries, tworząc dwie wyspecjalizowane ścieżki: jedną dla elementów lingwistycznych (słowa, gramatyka), drugą dla cech paralinguistycznych (głos mówcy, emocje, intonacja).

Wyniki pokazują konsekwentne rozdzielenie informacji w obu ścieżkach - informacja lingwistyczna pozostaje silniejsza w dedykowanej dla niej drodze, podczas gdy czynniki paralinguistyczne są zatrzymane w paralinguistycznej ścieżce i znacznie zmniejszone w lingwistycznej. Kluczowe odkrycie to że organizacja tras nauczonych na zbiorze LibriSpeech transferuje się na MSP-Podcast bez konieczności retrainowania po stronie reprezentacji. Interwencje na poziomie feature-space dodatkowo potwierdzają że można zamieniać informacje między ścieżkami zachowując integralność informacji w drugiej drodze.

To ma znaczenie dla kontrolowalności systemów rozpoznawania mowy i syntezy - pozwala na precyzyjne sterowanie tym, czy model ma uwzględniać czy ignorować paralinguistyczne cechy głosu. Wyniki są spójne na wielu modelach, zbiorach danych i metodach oceny, co sugeruje że podejście jest niezawodne i ma potencjał praktycznego zastosowania w aplikacjach wymagających separacji tych aspektów mowy.