Badacze stworzyli kompleksowy benchmark do oceny wydajności dużych modeli językowych w automatyzacji przesiewu artykułów podczas przeglądów systematycznych. Zbiór zawiera 45 064 oznakowanych wpisów z 32 wtórnych badań, a głównym wyzwaniem, które rozwiązuje nowa rama oceny, jest problem braku równowagi klas - w przesiewach systematycznych artykułów odrzuconych jest znacznie więcej niż zaakceptowanych, co powoduje, że tradycyjne metryki mogą być mylące.
Razem z benchmarkiem autorzy zaprezentowali PromptSR, narzędzie wspierające eksperymentowanie z różnymi promptami, zarządzanie testami i analizę wyników modeli używanych do przesiewu. System pozwala badaczom łatwo porównywać różne strategie promptowania i oceniać skuteczność LLM w kontekście specyficznym dla przesiewów systematycznych, gdzie tradycyjne podejścia do klasyfikacji nie radzą sobie dobrze.
To ma duże znaczenie dla nauki, bo przesiew artykułów w przeglądach systematycznych jest jednym z najbardziej czasochłonnych i żmudnych etapów badań naukowych. Automatyzacja tego procesu za pomocą LLM mogłaby uwolnić naukowców od rutynowej pracy, ale dotychczasowe sposoby testowania takich systemów nie uwzględniały specyfiki danych przesiewowych. Nowy framework stanowi krok w kierunku praktycznego wdrożenia AI w tego typu zadaniach.