Naukowcy stworzyli sposób na lepsze wykorzystanie dużych modeli języka w przesiewaniu artykułów dla przeglądów systematycznych poprzez połączenie LLM z pomocniczym klasyfikatorem BERT+GCN dostarczającym strukturyzowane sygnały niepewności. Zespół testował pięć różnych strategii dostarczania promptów na ośmiu zbiorach danych leków z benchmarku Cohen, przeprowadzając 600 testów z walidacją krzyżową (3 nasiona razy 5-krotna stratyfikowana walidacja). Model BERT+GCN trenowany dla każdego foldu klasyfikował prace badawcze jako INCLUDE, EXCLUDE lub MAYBE za pomocą dwóch testów spektralnych (radikal algebraiczny i paradoks kategoryczny).
Wyniki pokazały trzy kluczowe ustalenia. Po pierwsze, dostarczanie pełnego kontekstu informacji poprawiło wyniki F1 o 0,011 (p=0,008) i WSS@95 o 0,050 (p=0,039), ale wymagało 1,28-krotnie więcej tokenów. Drugą istotną znaleziskiem było to, że routing tylko papierów zaklasyfikowanych jako MAYBE okazał się optymalny w sensie Pareto - osiągnął najwyższą czułość 0,92 i AUC-ROC 0,54 przy kosztach zaledwie 1,05-krotnie wyższych od linii bazowej, czyli szóstej części obciążenia pełnego kontekstu. Po trzecie, dwu-przejściowy design eskalował 22,2 procent rekordów, ale nigdy nie zrewidował swojej decyzji, wykazując 0 procent zmian oznaczenia na wszystkich zbiorach danych.
To badanie ma znaczenie dla całej społeczności nauki, gdzie przeglądanie systematyczne artykułów naukowych jest konieczne, ale bardzo czasochłonne. Połączenie zaawansowanego modelowania niepewności z inteligentnym routingiem umożliwia automatyzację tego procesu bez utraty wiarygodności. Praktyczne znaczenie polega na redukcji nakładu obliczeniowego jednocześnie z utrzymaniem wysoko jakości przesiewu, co czyni tę metodę potencjalnie przydatną dla wielkoskalowych przeglądów literatury w nauce, medycynie i innych dziedzinach.