Naukowcy opracowali framework do oceny sprawiedliwości w dużych modelach audio Language Models, które coraz powszechniej stosuje się do rozpoznawania mowy i odpowiadania na pytania o treści audio. Problem w tym, że dotychczasowe ewaluacje mogły być introdudzące w błąd - ignorowały one zmienność semantyczną zawartości mówionych słów i indywidualne cechy głosu poszczególnych mówców.

Nowaproponowana metoda to semantic-aware mixed-effects regression framework. Polega ona na ekstrahowaniu sentence-level semantic embeddings z tekstu referencyjnego jako zmiennych kontrolnych i modelowaniu tożsamości mówcy jako efektu losowego. Sprytnie, reprezentacje semantyczne pochodzą z tego samego LALM-u, który się testuje - to pozwala na kontrolę zmienności tak, jak model ją postrzega. Podejście zostało sprawdzone na danych symulowanych i rzeczywistych benchmarkach.

Wyniki pokazują, że ta metoda znacznie redukuje fałszywe ustalenia na temat bias-u i dostarcza bardziej solidnych i interpretowalnych szacunków różnic w wydajności między subgrupami demograficznymi. To ważne zwłaszcza gdy modele audio znajdują zastosowanie w systemach krytycznych dla ludzi - lepsza ocena Fair-ness-u może zapobiec dyskryminacji określonych grup użytkowników.