Międzynarodowy zespół badaczy przeprowadził Token-matched eksperyment, aby sprawdzić, jak proporcje danych podręcznikowych (z tekstów medycznych) i klinicznych (z dokumentacji pacjentów) różnie kształtują możliwości medycznych LLM. Wyniki ujawniły asymetryczne przenoszenie umiejętności między typami zadań - dane kliniczne znacząco poprawiały wydajność w zadaniach zorientowanych praktycznie, ale pozostały konkurencyjne w zadaniach wymagających głębokiej wiedzy, podczas gdy dane podręcznikowe skupiały się przede wszystkim na celach teoretycznych.

Analiza błędów modeli wykazała istotną lukę między wiedzą a praktyką. Ulepszenia w przywołaniu faktów medycznych nie zawsze przekładały się na lepsze rozumowanie kliniczne czy diagnostykę. Badacze ustalili, że skromne ilości danych klinicznych już generują większość zysków na zadaniach związanych z elektroniczną dokumentacją medyczną EHR, ale optymalny stosunek zależy od konkretnych wymagań aplikacji.

Wnioskami pracy jest rekomendacja, aby strategie kuracji danych dla medycznych modeli były bardziej skonkretyzowane i dostosowane do zastosowania. Dla przypadków wymagających intensywnego rozumowania klinicznego systemy powinny korzystać z wyższego udziału danych rzeczywistych pacjentów, zamiast polegać głównie na podręcznikowej wiedzy teoretycznej, co może zmienić sposób trenowania przyszłych modeli medycznych.