Naukowcy stworzyli SurveyReview - kompleksowy benchmark do oceniania artykułów przeglądowych przez systemy AI, zawierający 675 anotowanych prac z 1630 autentycznymi raportami peer-review. Istniejące podejścia do ewaluacji przy użyciu dużych modeli językowych opierały się przede wszystkim na gotowych metodach LLM-as-a-judge bez systematycznego dopasowania do ocen człowieka, co stanowiło słabość w dobie automatyzacji pisania przeglądów.
Kluczową innowacją jest strukturyzacja wolnodostępnych komentarzy recenzentów w cztery wymiary oceny - Readability (czytelnością), Criticalness (krytycznością), Comprehensiveness (komprehensywnością) i Structure (strukturą) - wraz z uzasadnieniami dla każdej oceny. Zespół opracował model baseline SurveyAlign poprzez fine-tuning modelu Qwen3-32B z techniką LoRA na anotowanych danych, uzupełniając go zewnętrzną wiedzą dla wymiarów wymagających większego kontekstu. Standardowe podziały train/test i jasny protokół ewaluacji umożliwiają mierzenie dopasowania między automatycznymi ewaluatorami a recenzentami.
Wyniki są znaczące - SurveyAlign dramatycznie poprawia wyrównanie z recenzentami człowieka w porównaniu z podejściami opartymi na promptach do GPT-5.2, zmniejszając średni błąd kwadratowy MSE z 2.28 do 1.38 i średni błąd absolutny MAE z 1.15 do 0.69 na wszystkich czterech wymiarach. To rozwiązanie tyka ważnego problemu - wraz z eksplozją automatycznie generowanych przeglądów naukowych, niezawodna ewaluacja staje się wąskim gardłem, a opracowanie metodycznie uzasadnionych benchmarków jest niezbędne dla wiarygodności takiego procesu.