Zespół badawczy zajął się problemem rozpoznawania mowy w bardzo trudnych warunkach - nagraniach komunikacji policyjnej z Baltimore i Chicago, które zawierają znaczny szum tła. Istniejące modele ASR oparte na takich fundamentach jak Whisper czy Qwen3-ASR radzą sobie słabo na tak zniekształconych danych, a zdobycie tysięcy rzetelnie otagowanych nagrań policyjnych jest drogo i czasochłonne.
Badacze zbadali, czy pseudo-labelowanie - metoda, w której model najpierw etykietuje dane bez nadzoru, a następnie uczy się na tych etykietach - może tu pomóc. Odkryli jednak krytyczny problem: tradycyjne miary pewności wewnątrz modelu, takie jak log-prawdopodobieństwa czy STAR scores, nie potrafią odróżnić dobrych pseudo-labelów od złych na tak hałaśliwych materiałach. Dlatego wprowadzili innowacyjne rozwiązanie wykorzystując LLM jako sędziego do filtrowania transkrypcji - model językowy ocenia, czy zaproponowana transkrypcja ma sens w danym kontekście policyjnym i odrzuca niebezpieczne błędy.
Wyniki pokazały, że filtrowanie LLM działa bardziej agresywnie i efektywnie niż standardowe metryki, znacznie redukując błędy ortograficzne (WER) w zbiorach treningowych. Naukowcy zaproponowali również nową metodę cross-model pseudo-labelowania, gdzie jeden model wspomagany jest etykietami od drugiego modelu - to podejście uznali za obiecujące dla przyszłych prac w tej dziedzinie.