Naukowcy opracowali LitReview Arena, nową platformę do rzetelnej oceny jakości automatycznie generowanych przeglądów literatury naukowej przy udziale ekspertów z branży. Platforma wykorzystuje schemat podobny do turniejowych porównań, gdzie naukowcy z doświadczeniem w pisaniu artykułów naukowych porównują anonimowe projekty w ramach swojej specjalizacji, oceniając je na pięciu wymiarach specyficznych dla przeglądów - takich jak struktura pracy, syntetyzowanie źródeł czy sugestie badawcze.

Z analizy około 3 tysięcy eksperckich ocen wynika zaskakujący obraz stanu technologii. Nawet najlepsze dostępne systemy osiągają wynik zaledwie 23 procent zwycięstw w decydujących porównaniach względem przeglądów napisanych przez ludzi. Dla kontrastu, zaawansowane agenty działające na bazie LLM, takie jak Sonar Deep Research, przewyższają proste modele językowe o ponad 60 procent, co sugeruje że złożone systemy agentowe znacznie lepiej radzą sobie z tym zadaniem.

Badanie ujawniło również fundamentalny problem w obecnych metodach automatycznej oceny tekstów. Tradycyjne podejścia, gdzie modele językowe pełnią rolę sędziego, wykazują słabą korelację z osądami ludzi specjalistów - Spearman's rho wyniosło zaledwie 0,467. Problem jest szczególnie wyraźny w ocenie aspektów wymagających głębokich syntezy i analizy. Naukowcy zaproponowali rozwiązanie w postaci LitJudge, narzędzia przycalibrowanego na bazie eksperckich preferencji, które osiąga zgodność na poziomie 0,78 - porównywalne z konsystencją między różnymi ekspertami. Kod i dane zostały udostępnione publicznie.