Naukowcy opracowali DischargeBench, innowacyjny benchmark do oceny zdolności LLM-ów w edukacji pacjentów podczas wypisu ze szpitala. System działa na zasadzie symulacji, gdzie testowany model LLM prowadzi rozmowę wieloturową z Wirtualnym Pacjentem, podczas gdy niezależny Agent Monitor edukacji nadzoruje realizm pacjenta bez wpływu na samego edukatora. To rozwiązanie chroni czystość wyników ewaluacji.

Benchmark bazuje na rozszerzonej wersji danych MIMIC-IV i zawiera 477 przypadków klinicznych z 24 rozdziałów klasyfikacji ICD. Każdy wirtualny pacjent ma przypisane odrębne cechy: typ osobowości, poziom edukacji, zdolność rozumienia tekstów medycznych i zdolność do przywołania historii choroby. Każda symulacja jest oceniana na czterech wymiarach: jakość konwersacji, pokrycie istotnych tematów, zrozumienie pacjenta oraz spójność faktyczna. Ewaluację przeprowadza LLM-as-a-Judge skalibrowany względem adnotacji lekarzy.

Wyniki badania pokazują, że zarówno modele zamknięte, jak i open-source uzyskują wysokie zagregowane wyniki, ale te liczby maskują istotne różnice kliniczne w zależności od rodzaju pacjenta i zakresu medycznego. Szczególnie ujawniają się problemy przy pracy z pacjentami o niskiej zdolności rozumienia tekstów medycznych - modele zawodzą w dostosowaniu języka, wyjaśnieniu złożonych pojęć i zapewnieniu rzeczywistego uczenia się. Badanie konkluduje, że ewaluacja LLM-ów do edukacji klinicznej powinna koncentrować się na rzeczywistym zrozumieniu pacjenta, a nie tylko na jakości tekstu czy poprawności odpowiedzi.