Naukowcy z arXiv opracowali Survprompt - framework, który testuje zdolność dużych modeli językowych do prognozowania czasu przeżycia pacjentów. System konwertuje strukturalne dane pacjenta w naturalne opisanie przypadku klinicznego i prosi model o przewidzenie przeżycia bez wcześniejszego treningowania na tych danych (zero-shot).

Badania przeprowadzono na dwóch dużych zbiorach danych dotyczących nowotworów: publicznie dostępnym MSK-CHORD i nowym zbiorze z Providence St. Joseph Health Network. Wyniki pokazały, że modele graniczne takie jak GPT-5.6-Sol osiągnęły średni błąd bezwzględny (cMAE) mieszczący się w 10% wyników specjalistycznych modeli lesów przeżycia (RSF), które były trenowane specjalnie do tego zadania. Dla raka prostaty LLM uzyskał nawet lepsze rezultaty niż RSF. Analiza cech ujawniła, że modele językowe przypisywały wagę zmiennym klinicznym podobnie jak specjalistyczne modele przeżycia.

To badanie ma duże znaczenie dla medycyny, ponieważ pokazuje, że pacjenci mogą potencjalnie uzyskać wiarygodne prognozy od powszechnie dostępnych aplikacji LLM. Jednocześnie wyniki podkreślają potrzebę starannej oceny przed zastosowaniem LLM-ów w rzeczywistej praktyce klinicznej - modele mogą być przybliżone, a błędy w prognostyce onkologicznej mogą mieć poważne konsekwencje dla pacjentów.