Naukowcy ocenili zdolność współczesnych dużych modeli językowych do wsparcia praktyki medycyny tradycyjnej chińskiej, porównując je z rzeczywistymi lekarzami w ocenie rzeczywistych przypadków klinicznych. Analiza obejmowała 16 LLM i grupę 60 praktyków TCM, którzy oceniali 60 reprezentatywnych przypadków z biblioteki 349 spersonalizowanych przypadków ambulatoryjnych z 62 szpitali. Eksperci w dziedzinie TCM oceniali wyniki w dziewięciu wymiarach diagnostycznych i terapeutycznych.

Wielkie modele językowe ogólnego przeznaczenia, takie jak najnowsze wersje, uzyskały wyższe oceny od ekspertów niż lekarze w kilku obszarach, szczególnie w poradzeniu medycznym, wyjaśnianiu zasad leczenia i wybranych zadaniach diagnostycznych. To sugeruje, że modele mogą być cennymi narzędziami do wsparcia profesjonalistów medycznych w szybkim dostarczaniu porad i wyjaśnień klinicznych.

Jednak bardziej szczegółowa analiza na poziomie przepisów leków ujawniła istotne problemy. Modele wykazywały błędy w wyборze konkretnych ziół, nieprawidłowe dawkowanie oraz niekonsekwentne strategie terapeutyczne. Przegląd bezpieczeństwa zidentyfikował również halucynacje - izmyślone informacje - oraz sztywne, oparte na szablonach odpowiedzi, które mogą nie odpowiadać indywidualnym potrzebom pacjentów. Wnioski sugerują, że choć LLM mają potencjał jako narzędzia wspomagające decyzje w medycynie chińskiej, wymagają one ścisłego nadzoru lekarza, wbudowanych ograniczeń bezpieczeństwa i dalszych klinicznych badań prospektywnych.