Zespół badawczy z arXiv opublikował metodę transformacji systemów ASR, które dotychczas skupiały się na minimalizacji ogólnego Word Error Rate, pomijając krytyczne dla uczenia języka elementy takie jak nazwane encje i dysfluencje w mówionej angielszczyźnie z akcentem. Nowy pipeline zbudowany wokół modelu Qwen2.5-Omni-3B osiąga 80-85 procent entity recall dla mówiących z Indii, Indonezji i krajów Ameryki Łacińskiej - wzrost z zaledwie 53-55 procent w systemach optymalnych dla WER.

Pipeline opiera się na trzech kluczowych komponentach. Po pierwsze, heurystyczne filtry SQL wybierają dane treningowe bogate w encje z densją 2.8 razy wyższą niż losowe próbkowanie. Po drugie, regionalne adaptery LoRA fine-tunowane na Qwen2.5-Omni-3B generują zarówno dosłowne transkrypcje jak i wersje poprawione w jednym przebiegu. Po trzecie, sześciokategoriowy system klasyfikacji błędów walidowany przez sędziego LLM osiąga 83.8 procent zgody z ocenami ludzkimi na próbie 210 samples.

Wyniki są imponujące szczególnie dla fillerów - system rozpoznaje 76-86 procent wypełniających pauz wobec mniej niż 5 procent we wcześniejszych podejściach. Utrzymując 6-10 procent WER na 6 tysięcy zdań testowych, system przewyższa Whispera i komercyjne rozwiązania ASR w recall encji, jednocześnie dorównując zeru-shotowemu modelowi 30B przy użyciu 10 razy mniej parametrów. Statystyczne testy bootstrap wykazują, że sama kuracja danych odpowiada za wzrost 2.8-4.2 punktu procentowego w entity recall.