Zespół badaczy odkrył paradoks w adaptacji modeli diarizacji mowy - ulepszczenie metryk zadaniowych ukrywa poważne problemy z utrzymywaniem tożsamości mówiących. Pracowali ze streamingowym diariizerem, który adaptowali na zaledwie 7,5 godziny nagrań rozmów między dwiema osobami, a następnie testowali na sześciu różnych zbiorach danych mówiących od różnych grup ludzi.
Adaptacja rzeczywiście poprawiła wydajność modelu na danych z tej samej domeny i dobrze transferowała się na niezależny korpus testowy. Jednak dokładniejsza analiza ujawniła, że model ma problemy z utrzymywaniem spójności tożsamości głosów w czasie - inaczej mówiąc, traci ślad tego, który głos należy do której osoby w trakcie nagrania. Problemy te różnią się w zależności od charakteru danego zbioru danych. Gdy badacze zastosowali rehearsal (przechowywanie próbek z oryginalnych danych treningowych), degradacja tożsamości zmniejszyła się, ale kosztem pogorszenia transferu do nowych domen.
Badanie podkreśla krytyczną lukę w ocenie modeli diarizacji - tradycyjne metryki mogą sugerować poprawę ogólnej wydajności, podczas gdy ukrywają głębokie problemy strukturalne. Dla praktycznego wdrażania systemów diarizacji to oznacza, że trzeba jednocześnie monitorować dokładność wykrywania mowy, spójność przypisywania tożsamości oraz zdolność do uczenia się bez katastrofalnego zapominania.