Systemy ASR czasami generują fluent tekst, który jest całkowicie niepowiązany z mową, którą otrzymują - zjawisko znane jako halucynacja. Naukowcy z arXiv zbadali, gdzie dokładnie w architekturze modelu dochodzi do tego zjawiska, testując dwa niezależnie wytrenowane modele Conformer-Large: jeden oparty na CTC, drugi na RNN-T, w warunkach pogorszenia jakości audio i zmian w tle mowy.

Kluczowe odkrycie dotyczy ostatniego etapu enkodera, który okazał się punktem krytycznym dla grounding, czyli powiązania tekstu z rzeczywistym audio. Omijając ostatni blok enkodera, model prawie na każde wypowiedzi podawał niepoprawne lub powtarzające się dane wyjściowe, podczas gdy pomijanie bloków ze środka architektury miało niewielki efekt. Dokładnie na tym etapie reprezentacje stają się bardziej zwarte, tekst staje się czytelny dla dekodera, a informacje grafemowe stają się eksplicytne.

Wynik badania identyfikuje mechanistyczne warunki wstępne dla halucynacji - niepowodzenie w produkowaniu dobrze ugruntowanego wyjścia - choć nie wyjaśnia całego pochodzenia naturalnych halucynacji. Odkrycia ujawniają konsekwentną zależność od ostatniego etapu w całym procesie rozpoznawania dla obu rodzin dekoderów i wielu zmian w rozkładzie danych, co ma znaczenie dla budowania bardziej niezawodnych systemów.