Modele uczenia maszynowego przewidujące premature przerwanie leczenia uzależnienia od opioidów mogą wykazywać znaczące różnice w wydajności między grupami pacjentów, nawet gdy ich ogólna dokładność wygląda zadowalająco. Naukowcy z użyciem zbioru danych Treatment Episode Data Set-Discharges (TEDS-D) obejmującego epizody leczenia od 2015 do 2019 roku przeszkolili cztery różne modele ML do przewidywania, czy pacjenci przerwą leczenie przedwcześnie czy utrzymają je przez ponad 180 dni. Zaobserwowali istotne nierówności w błędach predykcji między grupami definiowanymi przez rasę, pochodzenie etniczne, wiek i płeć.
Zagadnienie uczciwości algorytmów w medycynie to krytyczne zagadnienie, ponieważ niesprawiedliwe modele mogą wzmacniać istniejące nierówności zdrowotne i prowadzić do gorszych wyników dla grup marginalizowanych. Model o 85 procentowej ogólnej dokładności może osiągać zaledwie 70 procent w jednej grupie pacjentów i 90 procent w innej, co będzie miało realny wpływ na decyzje kliniczne. Badania pokazują, że techniki mitygacyjne, takie jak przeksztalcanie danych czy dostosowywanie progów decyzyjnych, mogą zmniejszać te różnice, ale ich całkowita eliminacja wymaga bardziej fundamentalnych zmian w podejściu do trenowania modeli.
Wyniki te podkreślają, że wdrażanie modeli AI w medycynie wymaga rygorystycznej oceny nie tylko globalnej wydajności, ale również uczciwości dla poszczególnych populacji. Badacze wskazują, że ocena modeli powinna obejmować analizę błędów na poziomie podgrup i że sama zmiana algorytmu nie wystarczy - niezbędne są również zmiany w zbiorach treningowych i procesach dizajnu systemu.