Naukowcy z badań nad sztuczną inteligencją przedstawili DeepInstructor - nowy system, który ocenia idee badawcze w bardziej ludzki sposób, poprzez analizę strukturyzowanych doświadczeń zgromadzonych z recenzji naukowych. Poprzednie podejścia polegały na samodzielnej wiedzy dużych modeli językowych lub na niesystematycznym wyszukiwaniu informacji, co prowadziło do ocen pozbawionych głębi uzasadnienia. DeepInstructor zmienia to, konstruując graf doświadczeń z 58 607 recenzji peer-review i używając agenta opartego na metodzie ReAct do wydobywania dowodów dla każdego aspektu oceny.

Sistem analizuje trzy wymiary: nowatorstwo, znaczenie naukowe i wykonalność, tracąc każde uzasadnienie. W eksperymentach wykazał ponad 24-procentową poprawę w wyrównaniu z ocenami człowieka w porównaniu do istniejących rozwiązań. Badacze wprowadzili również DeepInstruct - zestaw danych zawierający kontrolowane porównania parami, który wspiera trening i ewaluację takich systemów.

To ma znaczenie dla przyspieszenia badań naukowych, bo ostatnio LLM mogą generować pomysły szybciej niż ludzie je oceniają. System pokazuje, że zamiast opierać się na ogólnej wiedzy modelu, można zbudować bardziej wiarygodny system oceny poprzez zanurzenie go w faktycznym doświadczeniu naukowym. Takie podejście potencjalnie zmienia dynamikę automatyzacji odkryć naukowych.