Badacze opracowali framework PTC-Bias, który rozwiązuje problem efektywnego wykorzystania dużych list słów uprzedzenia w modelach SpeechLLM. Metoda działa w dwóch etapach: najpierw podczas prefill etapu wykonuje dekodowanie fonemów zsynchronizowane z ramkami audio i temporalną konkurencję między kandydatami, generując zwartą listę słów uprzedzenia z odpowiadającymi im interwałami. Następnie po dekodowaniu przez SpeechLLM drugi etap przeprowadza lokalną konkurencję między pobranymi kandydatami a niedopasowanymi fragmentami transkrypcji.
Rozdział nad podejściami jest znaczący, ponieważ PTC-Bias wymaga tylko jednego zestawu posteriorów fonemowych i nie generuje dodatkowych przesłów przez model. W eksperymentach na zbiorze LibriSpeech przy użyciu modelu Prompt-SLAM-ASR-7B i 2000 słów uprzedzenia metoda osiągnęła zmniejszenie B-WER o 23,4 procent na zestawie test-clean i 23,9 procent na test-other w stosunku do metody CTC-Filter, przy zachowaniu niemal niezmienionym wskaźnika U-WER. Rezultaty pozostały spójne dla dwóch różnych SpeechLLM i list uprzedzenia do 2000 słów, co sugeruje solidność rozwiązania.
Metoda jest szczególnie ważna dla praktycznych zastosowań, gdzie rozpoznawanie słów specjalistycznych, nazwisk czy terminy rzadko używane stanowią wyzwanie. Selektywna korekcja zmniejsza błędy związane z homofonami i segmentacją słów, co poprawia użyteczność systemów rozpoznawania mowy w rzeczywistych scenariuszach.