Naukowcy opracowali potok przetwarzania oparty na dużych modelach językowych do automatycznego wyodrębniania informacji z 536 artykułów naukowych poświęconych modelowaniu rozprzestrzeniania chorób na poziomie agentów. Wyniki pokazały, że GPT-4.1 uzyskała dokładność 77,95 proc., a nowszy GPT-5.0 osiągnął 81,67 proc. Niemniej jednak dokładność poszczególnych pól danych wahała się znacznie - od zaledwie 32,40 proc. dla bardziej złożonych lub subiektywnych kategorii do 100 proc. dla pól jednoznacznych.

Badacze zweryfikowali rezultaty LLM-ów poprzez porównanie z przeglądem systematycznym przeprowadzonym ręcznie przez ludzi. Odkryli ciekawą prawidłowość: kiedy dwa różne modele LLM dają sprzeczne odpowiedzi, może to sygnalizować halucynacje - fikcyjne dane generowane przez model. Równocześnie wysoka zgodność między modelami połączona z niską dokładnością w stosunku do danych referencyjnych sugerowała błędy w oryginalnym zbiorze danych.

Studium dostarcza praktycznych wskazówek dotyczących tworzenia promptów i demonstruje zarówno potencjał, jak i ograniczenia automatyzacji pełnowymiarowych przeglądów systematycznych za pomocą LLM-ów w dziedzinie modelowania i symulacji. Wyniki sugerują, że podczas gdy modele językowe mogą znacznie przyspeszy proces przeglądu literatury, pozostają obszary wymagające ludzkiej weryfikacji, szczególnie w przypadku bardziej kompleksowych kategorii informacji.