Modele mowy takie jak Whisper są audytowane pod kątem sprawiedliwości demograficznej w pełnej precyzji, ale wersje wdrażane w produkcji przechodzą kompresję wagi poprzez pruning, kwantyzację i destylację. Zespół naukowców zbadał, czy te techniki post-trainingowe zmieniają rozkład błędów między grupy demograficzne.

Wyniki są alarmujące. Przy 50% prunigu Whisper-large-v3 różnica w współczynniku błędów słów między użytkownikami afroamerykańskimi a azjatyckimi na zbiorze Fair-Speech ponad się podwoiła. To oznacza wzrost z 30 do 64 sekund czasu korekcji na minutę mowy - czyli wzrost o 111 procent. Efekt był niezmienny względem założonego kosztu korekt. Kwantyzacja INT4 dla mniejszych modeli doprowadziła do jeszcze gorszych wyników, pogorszając transkrypcje dla akcentów zachodnioafrykańskich pięć do siedem razy.

Znajomity rezultat pokazała destylacja modelów - technika polegająca na transferze wiedzy z większego modelu do mniejszego. W 21 z 27 testowanych scenariuszy destylacja zmniejszyła różnice między grupami demograficznymi. Badacze wprowadzili formalny konstrukt temporal taxation jako metrykę do pomiaru tego zjawiska, otwierając nową perspektywę na sprawiedliwość w systemach AI przeznaczonych do szerokiego wdrażania.