Naukowcy stworzyli rigorous benchmark do oceny prac generowanych przez autonomiczne systemy AI, wykorzystując automatyczną recenzję opartą na trzech wiodących modelach językowych. Zastosowali zautomatyzowany system recenzji peer-review pracujący z GPT-5.4, Gemini i Claude do oceny artykułów naukowych w czterech kluczowych wymiarach: oryginalności, rygorze naukowym, przejrzystości i znaczeniu.

Badanie porównało cztery wiodące platformy AI Scientist - Sakana AI w wersjach v1 i v2, CycleResearcher oraz Data-to-Paper. Każdy system testowano na identycznym zbiorze 15 propozycji badawczych, generując 60 prac ocenianych obok 15 artykułów benchmarkowych z systemu FARS. Wyniki wyraźnie pokazały przewagę FARS: osiągnął średnie wyniki 2,14-2,47 na skali 1-5, podczas gdy pozostałe systemy uzyskały 1,00-1,87. Na ewaluacjach Gemini i Claude FARS skorował ponad dwukrotnie wyżej od następnego najlepszego systemu.

Znaczące odkrycie dotyczy niezawodności automatycznej oceny. Gemini i Claude wykazały bardzo silną zgodność wyników (rho = 0,907, p < 0,001) i obie Models skorelowały się ekstremalnie silnie z syntetycznym wynikiem (rho = 0,961, p < 0,001), validując rzetelność zautomatyzowanego benchmarkowania. GPT-5.4 wykazał nieco słabszą zgodność. Te wyniki sugerują, że frontier LLM mogą stanowić niezawodne narzędzie do systematycznej oceny jakości prac generowanych przez systemy autonomicznego badania naukowego.