Zespół badawczy opracował SciLitBench, nowy benchmark specjalnie zaprojektowany do oceny możliwości modeli językowych w asystowaniu przy systematycznych przeglądach literatury naukowej. Benchmark obejmuje wszystkie kluczowe etapy tego procesu: screening na podstawie tytułów i abstraktów, szczegółową analizę pełnych tekstów oraz ekstrakcję strukturalnych danych ze znalezisk. Zbiór zawiera 42 981 pobranych rekordów, 1012 pełnych tekstów artykułów i adnotacje dla 888 pozytywnie zakwalifikowanych prac.

Badania przeprowadzone na 22 otwartych modelach z sześciu różnych rodzin wykazały interesujące wzorce. Na etapie screeningu tytułów i abstraktów wyraźnie sformułowane kryteria włączenia i wykluczenia artykułów podniosły wynik F2 o 28,8 procent, a uzasadnienia autorów artykułów złożyły do poprawy pełnotekstowego screeningu o 15 procent. Jednak ekstrakcja danych pokazała znacznie większe wyzwania - dokładność spada z imponujących 0,97 dla informacji takich jak rok publikacji do zaledwie 0,37 dla określenia zastosowanego podejścia obliczeniowego.

Najmocniejsze modele udało się tylko odzyskać 30 procent adnotowanych dowodów na oceny metodologiczne badań i 25 procent zidentyfikowanych ograniczeń ich wyników. Benchmark wyznacza praktyczną granicę między etapami, na których modele osiągają wysoką czułość, a fazą ekstrakcji, gdzie potrzebna jest znacznie wyższa kompletność. SciLitBench stanowi pierwszy reproducible resource do ewaluacji modeli AI w kontekście Evidence Synthesis, wskazując, że zamiast pełnej automatyzacji najbardziej realistyczne podejście to asystencja przy pracochłonnych etapach przeszukiwania i selekcji literatury.