Modele językowe coraz częściej angażują się w ocenę prac naukowych jako automatyczne recenzje oraz asystenci dla recenzentów ludzi. Problem pojawia się, gdy syntetyczne recenzje trafiają do publicznych zbiorów danych i przyszłych korpusów treningowych - kolejne pokolenia AI uczą się od sądów wydanych przez wcześniejsze modele, tworząc rekurencyjną pętlę sprzężenia zwrotnego. Badacze zbadali jeden krok tej pętli w kontrolowanym eksperymencie, zaczynając od Llama 3.1 8B i finetuningując ją na oficjalnych recenzjach z ICLR z lat 2018-2023, a następnie trenując cztery modele następne na danych ICLR 2024 z systematycznie zmienianymi mieszankami recenzji autentycznych i generowanych.

Wyniki jasno pokazały niebezpieczny efekt uboczny tego podejścia. Wprowadzenie syntetycznych recenzji kompresuje rozkłady ocen i zmniejsza zarówno różnorodność semantyczną na poziomie pojedynczych prac, jak i całych korpusów. Badacze nazwali to zjawisko zapaścią ocen naukowych. To zagrożenie jest poważne, bo może prowadzić do uniformizacji opinii naukowych i utraty cennej różnorodności perspektyw w peer review.

W odpowiedzi na to odkrycie zespół opracował TrustReviewer - otwarte narzędzie oparte na LLM do generowania recenzji prac z zakresu AI i machine learningu. System działa na dwóch poziomach jednocześnie. Na etapie treningu zapobiega problemowi poprzez szkolenie modelu na starannie wybranym korpusie danych zmniejszającym nadzór niskiej jakości i degeneracyjny. Na etapie testowania stosuje paired activation steering, aby łagodzić pozostałe tendencje do zapaści sądów bez dodatkowego treningu lub adnotacji ekspertów.