Zespół badawczy zbadał dokładność ośmiu dużych modeli językowych w ocenie przyczynowych twierdzeń medycznych i ich uzasadniania opublikowanymi badaniami naukowymi. W celu systematycznej oceny performansu obecnych i przyszłych LLM stworzyli dedykowany framework do weryfikacji hipotez przyczynowych. Badanie obejmowało 17 hipotez medycznych, których poparcie naukowe modele oceniały na podstawie literatury biomedycznej.
Analiza przeprowadzona na 1067 punktach anotacji szerint sześć kryteriów jakości wykazała sprzeczny obraz możliwości LLM. Z jednej strony modele wykazują silne recall - potrafią sobie przypomnieć i przywołać istotne informacje z zakresu wiedzy medycznej. Z drugiej jednak strony poważnie zawodzą w kluczowych aspektach: nie potrafią niezawodnie podawać wiarygodnych, rzeczywistych artykułów naukowych jako dowodów, a także mają problemy z odrzucaniem hipotez, które nie mają poparcia w opublikowanych badaniach.
Te rezultaty wskazują na krytyczne ograniczenie obecnych LLM w zastosowaniach medycznych. Chociaż modele mogą efektywnie odpowiadać na pytania o choroby, objawy i leczenie, ich zdolność do dokładnej oceny relacji przyczynowych i gruntowania wniosków w zweryfikowanych dowodach naukowych pozostaje problematyczna. To oznacza, że nie można im jeszcze w pełni zaufać w roli systemów wyszukiwaczy informacji medycznych, zwłaszcza w kontekście wysokiego ryzyka związanego z opieką zdrowotną.