Zespół Transsion Speech zaprezentował rozwiązanie wykorzystujące trzyetapową architekturę do automatycznego rozpoznawania wielojęzycznej mowy conversacyjnej z przypisaniem każdego fragmentu tekstu odpowiadającemu mu mówcy. System zajął drugie miejsce w wyzwaniu MLC-SLM 2026, osiągając wskaźnik błędu tcpMER na poziomie 15,41%.
Ramach pracy Transsion zbudował system na trzech filarach. Pierwszy moduł diaryzacji speaker-homogenicznych segmentów opiera się na DiariZen i wykorzystuje lokalną estymację aktywności mówcy oraz globalny clustering do identyfikacji różnych uczestników rozmowy. Drugi komponent bazuje na modelu Qwen3-Omni i generuje transkrypcje dla wielu języków jednocześnie. Do precyzyjnego wyrównania słów i znaków z audio system używa zewnętrznego modelu CTC. Ostatecznie moduł fuzji łączy wyniki diaryzacji z opatrzonymi znacznikami czasowymi transkrypcjami, tworząc ostateczne transkrypty ze wskazaniem mówcy w formacie STM.
Rezultaty pokazują, że kaskadowe podejście Transsion jest skuteczne dla tak złożonego zadania. Osiągnięcie drugiego miejsca w międzynarodowym wyzwaniu podkreśla znaczenie precyzyjnego wyrównania czasowego i integracji informacji o mówcach. Taki system znajduje zastosowanie w transkrypcji konferencji, wywiadów, podcasetów i rozmów biznesowych, gdzie istotne jest nie tylko co zostało powiedziane, ale i kto to powiedział.