Po raz pierwszy naukowcy przeprowadzili zdyscyplinowaną analizę porównawczą wielojęzycznych modeli pre-trenowanych do rozpoznawania mowy w języku nepalskim, porównując sześć podejść architektonicznych na identycznych zbiorach danych i protokołach treningowych. Badanie obejmowało fine-tuning modeli XLSR-53, IndicWav2Vec, MMS-1B, Whisper-Medium, Whisper-Large-v3-Turbo i Conformer-Hi na korpusie OpenSLR SLR54 zawierającym około 165 godzin nagrań w języku nepalskim, z użyciem standardowych parametrów optymalizacji i harmonogramów wskaźnika uczenia dostosowanych do rodziny modelu.
Wyniki pokazały, że Whisper-Large-v3-Turbo i IndicWav2Vec osiągnęły najlepszą dokładność z Word Error Rate na poziomie około 15 procent, mimo ogromnych różnic między modelami - Whisper ma 9 razy więcej parametrów i został trenowany na 40 razy większej ilości danych. Odkrycie to stanowi empiryczny dowód, że bliskość rodziny języków w danych treningowych może efektywnie zastąpić surową skalę modelu dla konkretnego języka, co ma znaczące implikacje dla opracowywania systemów ASR dla języków mniej zasobnych. Równocześnie modele CTC okazały się 29 razy szybsze niż autoregresywne warianty Whisper przy zachowaniu porównywalnej dokładności, co całkowicie zmienia praktyczne podejście do wdrażania - systemy zorientowane na szybkość powinny teraz preferować architektury CTC zamiast większych modeli.
Badanie ujawniło także, że masywnie wielojęzyczne pretraining, takie jak w modelu MMS-1B, lepiej zachowuje dokładność na nowych danych testowych z poza domeny, co sugeruje że skala danych treningowych kupuje odporność modelu raczej niż maksymalną dokładność na znanych zbiorach. Publikacja stanowi pierwszy ustandaryzowany benchmark dla nepalskiego ASR z uwzględnieniem wydajności obliczeniowej, co powinno posłużyć jako punkt odniesienia dla przyszłych badań nad systemami rozpoznawania mowy dla języków mniej reprezentowanych w zasobach treningowych.