Naukowcy z projektu Ermis AI opublikowali CVSS-X, rozszerzenie poprzedniego korpusu CVSS dedykowane tłumaczeniu mowy z angielskiego na 28 języków obejmujących 12 rodzin językowych. Nowy zbiór zawiera około 240 tys. par równoleglejych nagrań na każdy język, łącznie ponad 16 tys. godzin audio - znacznie więcej niż oryginalne 2 tys. godzin CVSS.

Korpus dostępny jest w dwóch wariantach: CVSS-X-C z dwoma kanonicznymi głosami na język oraz CVSS-X-T wykorzystujący cross-lingualny kloning głosu, wszystko wygenerowane syntetycznie. Podczas ewaluacji corpus wykazał jakość tłumaczeń porównywalną z CVSS, zachowując spójną wydajność niezależnie od typologicznej różnorodności języków. To oznacza, że system działa równie dobrze na językami o zupełnie innej strukturze gramatycznej.

Zasoby zostały udostępnione na zasadzie open-source na licencji CC-BY-NC 4.0 poprzez HuggingFace, a kod dostępny jest na GitHubie. W połączeniu z oryginalnym CVSS-X otwiera to możliwości badań nad dwukierunkowymi systemami tłumaczenia mowy oraz głęboką analizą tłumaczenia między wieloma językami jednocześnie.