Naukowcy zaprezentowali Peerify - pipeline'ową metodę do automatycznej weryfikacji twierdzeń z recenzji naukowych na podstawie tekstu manuskryptu. System bierze recenzję i artykuł, rozbija opinię recenzenta na poszczególne, atomowe twierdzenia, wyszukuje w tekście pracy istotne fragmenty, a następnie określa, czy każde z twierdzeń ma wystarczające poparcie w manuskrypcie.
Zesp ół badaczy stworzył do tego celu benchmark składający się z 800 twierdzeń zaczerpniętych z autentycznych interakcji pomiędzy autorami a recenzentami na konferencjach NeurIPS 2024 i ICLR 2024. Dodatkowo przygotowali 300-elementowy podzbiór ręcznie etykietowany, który posłużył do audytu automatycznego etykietowania. Automatyczne etykiety osiągnęły 90.3% zgodność z opinią człowieka na audytowanym zbiorze (kohen kappa = 0.87), co wskazuje na przydatność podejścia.
Ewaluacja wykazała znaczące wyzwania - off-the-shelf modele entailment'u utknęły poniżej 0.24 macro-F1, co pokazuje, że obecne rozwiązania ogólnego przeznaczenia niepowstrzymująco się na tym zawodzą. Badanie podkreśla centralną rolę strategii wyszukiwania i rozbicia twierdzeń, jednocześnie ilustrując trudności wynikające z niejednoznacznych i interpretatywnych opinii recenzentów. Peerify otwiera drogę do bardziej efektywnego wspomagania procesu recenzji naukowej poprzez automatyzację weryfikacji faktów.