Zespół badaczy zaproponował CDPR - nową metodę trenowania modeli AI do diagnostyki medycznej, która nagrodzę przypisuje na podstawie porównania wyborów modelu z jego alternatywami. W praktyce medycznej lekarz nie diagnozuje od razu wszystkimi dostępnymi badaniami, ale rozumnie ordynuje je jedna po drugiej, obserwując wyniki i aktualizując hipotezę. Większość obecnych modeli medycznych ignoruje ten proces i traktuje diagnozę jako statyczną klasyfikację, zapominając o kluczowej rzeczywistości: każde badanie ma koszt, a czasem jest niewykonalne.

Gównym problemem techniczny było przypisanie kredytu w długim ciągu decyzji. Sygnał zwrotny przychodzi dopiero na koniec diagnostyki, co powoduje że model równo nagrodzić może diagnozę opartą na 20 tanich testach i tę opartą na pięciu drogich badaniach. CDPR rozwiązuje to poprzez analizę stanów, w których polityka modelu jest niepewna w wyborze akcji, a następnie ocenę każdego ruchu poprzez porównanie go z tym, co model rozważałby zamiast tego. Ocena bierze pod uwagę zarówno poprawność diagnozy, jak i liczbę, koszt oraz wykonalność badań. Dodatkowo autorzy dodali pamięć podręczną, która ponownie wykorzystuje trajektorie z obliczeń w partii, aby utrzymać koszty obliczeniowe na rozsądnym poziomie.

Model przetestowano na trzech zbiorach danych: MIMIC-IV (ten sam typ danych, na których trenowano), ClinicalBench (inny typ, różne systemy medyczne) i prywatnym zbiorze szpitalnym. We wszystkich przypadkach CDPR poprawiał dokładność diagnozy przy jednoczesnym wyraźnym zmniejszeniu liczby i kosztów zamówionych badań. To może mieć praktyczne znaczenie: modele AI wspierające diagnostykę mogłyby zmniejszić niepotrzebne badania, obniżyć koszty leczenia i przyspieszyć proces diagnostyczny dla pacjentów.