Zespół badaczy wykazał, że modele języka mogą być efektywnym uniwersalnym narzędziem do predykcji klinicznej bez konieczności budowania specjalistycznych architektur dla każdego zadania. Zamiast łączyć różne enkodery dla tekstu i danych liczbowych, naukowcy po prostu konwertują wszystkie informacje pacjenta - od notatek lekarskich do wartości laboratoryjnych - w jedną sekwencję tekstową i dostrajają pretrenowany model końcu do końca.

Badania przeprowadzono na trzech odrębnych zadaniach klinicznych. Pierwsze dotyczyło przewidywania śmiertelności pacjentów w szpitalach na bazie zbioru MIMIC-III. Drugie skupiało się na prognozowaniu niepowodzenia przeszczepu na podstawie danych longitudinalnych z niemieckiego centrum transplantacyjnego. Trzecie to klasyfikacja pacjentów pogotowia ratunkowego na podstawie zapisów z karetki. Autorzy porównywali zarówno modele oparte na enkoderach takie jak ModernBERT, jak i modele dekoderowe - Llama 3.1, Gemma, DeepSeek-R1-Qwen i Qwen3 - z ustalonymi systemami wielomodalnymi.

Wyniki są zaskakujące: proste tekstowe podejście serializacji danych równa się lub przewyższa specjalistyczne systemy wielomodalne opracowane specjalnie dla danego zadania. Jeszcze bardziej imponujące jest to, że nowa metoda przewyższa model gradient boosting który jest aktualnie używany w praktyce klinicznej do zarządzania pacjentami po przeszczepach. To sugeruje, że uniwersalne podejście bez bespoke'owych architektur fusji danych może być praktyczną alternatywą dla złożonych systemów zaproponowanych w przeszłości.