ICD-Deepresearch to nowy workflow agentyczny łączący foundation modele z głębokim researciem medycznym do przewidywania, które kody diagnostyczne pojawią się na przyszłych wizytach pacjentów. Zadanie jest prospektywne i wieloznaczne - docelowa notatka nie istnieje jeszcze, a poprawnych może być kilka kodów jednocześnie.
System działa w trzech etapach. Najpierw Candidate Generation używa SparseEHR do wygenerowania EHR Prior na podstawie strukturalnych danych pacjenta. Następnie Research Expansion odbywa się w dwóch rundach z ograniczonym budżetem - kandydaci są walidowani przez łączenie dowodów z akt pacjenta, zewnętrznych relacji klinicznych i semantyki kodów ICD. Równolegle niezależny model GPT-5 generuje bezpośrednią prognozę dostarcz komplementarne kandydaty. Na koniec moduł Final Selection deduplikuje i wspólnie rankuje oba zestawy, zaś osobny moduł dodaje uzasadnienie bez zmiany predykcji.
Na zbiorze MIMIC-III system osiągnął średnią precyzję 24,60 procent i recall 35,09 procent, a na MIMIC-IV - precyzję 25,14 procent i recall 48,32 procent. Kluczową zaletą jest ocena lekarzy - 51 procent dokumentów z MIMIC-III i 68 procent z MIMIC-IV uznali za użyteczne, podczas gdy samodzielne GPT-5 web search osiągnęło zaledwie 22-39 procent, a Medical Deep Research 32-41 procent. To pokazuje, że agentyczne podejście łączące wiele źródeł danych i modeli istotnie poprawia wiarygodność i przydatność kliniczną prognoz.