Naukowcy udostępnili na platformie Hugging Face syntetyczny dataset zawierający 10 tys. par audio-tekst dla scenariuszy obsługi klienta w telekomunikacji. Zbiór zawiera 26,82 godziny mowy 24 kHz, z podziałem na train (9 tys. próbek), validation (500) i test (500). Mowa została wygenerowana przy pomocy OmniVoice w voice-cloning mode, używając rzeczywistego nagrania i transkrypcji kobiecego głosu, z bfloat16 precision i 16 krokami diffusion sampling.
Dataset jest dostępny na licencji CC-BY-4.0 i zawiera zarówno oryginalny bengalski tekst, jak i znormalizowany field transkrypcji dedykowany do treningu i ewaluacji modeli ASR/STT. Normatywne transkrypcje są kluczowe dla dokładnego trenowania systemów rozpoznawania mowy, zwłaszcza w domenie customer care, gdzie precyzja ma bezpośredni wpływ na jakość obsługi klienta.
Ewaluacja przeprowadzona przy pomocy fine-tunowanego modelu Whisper - pochodnej bengaliAI/tugstugi_bengaliai-regional-asr_whisper-medium - wykazała imponujące wyniki: średni WER (word error rate) wynosi 2,54 procent, a CER (character error rate) 0,59 procent, przy medianowych wartościach 0,00 procent. Autorzy przeprowadzili też ręczną weryfikację wybranych próbek. Zarazem artykuł dyskutuje ograniczenia syntetycznej mowy i ewaluacji opartej na STT, sugerując że wyniki mogą być optimistyczne ze względu na adresowanie tego samego modelu tego samego studia głosowego.