Badacze z QCRI przeprowadzili kompleksową analizę adaptacji systemów rozpoznawania mowy dla dzieci, jednocześnie zachowując wysoką wydajność dla mówców dorosłych. Problem, który badali, jest praktycznym wyzwaniem: modele ASR trenowane na mowie dzieci lub osób uczących się języka obcego często degradują wydajność na standardowych testach dorosłych, takich jak LibriSpeech czy MGB-2.
Team porównał trzy podejścia adaptacyjne - pełny fine-tuning, LoRA oraz post-hoc weight-space merging - na trzech typach architektur: encoder-decoder, encoder-CTC i AudioLLM-based (takie jak Whisper). Eksperymenty obejmowały głosy arabskich dzieci natywnych i uczących się języka, angielskie próbki z zestawu MyST oraz benchmarki dorosłych z MGB-2 i LibriSpeech. Wprowadzili metryki do ilościowego pomiaru kompromisu: Retention Index, Child Adaptation Gain i Adaptation Recovery.
Wyniki wskazują, że bezpośrednia adaptacja jest konieczna, szczególnie dla niestandardowej mowy dziecka, ale prostej fine-tuning często pogarsza wydajność na mowie dorosłych. Kluczowym odkryciem jest to, że techniki łączenia wag - zwłaszcza LERP dla zachowania wydajności dorosłych i TIES dla silniejszych zysków dla dzieci - oferują lepszy kompromis. Adaptacja bilingwalna okazała się bardziej stabilna niż adaptacja specyficzna dla języka. Kod i modele zostały udostępnione na GitHubie, co umożliwia społeczności dalsze badania nad bardziej inkluzywnym rozpoznawaniem mowy.