Naukowcy zaproponowali Dude - pierwszy system multi-agentowy oparty na modelach LLM specjalnie do wykrywania rozbieżności między papierami a kodem. Problem, który rozwiązuje, jest realny i rosnący: liczba publikacji naukowych przekracza możliwości ręcznej weryfikacji, a rozbieżności między opisanymi algorytmami a implementacją to częsty problem w reproducible science.

Klucz do innowacji Dude tkwi w zrozumieniu, dlaczego wcześniejsze podejścia single-agent działały słabo. Artykuły naukowe operują dużą granularności, opisując algorytmy na wysokim poziomie abstrakcji, podczas gdy kod jest szczegółowy i konkretny. Ta asymetria prowadziła do tego, że agenty LLM albo interpretowały zbyt dużo (over-interpretation), albo zgłaszały fałszywe alarmy (over-reporting). System Dude implementuje granularity-aligned negotiation - mechanizm, w którym agenty uzgadniają poziom abstrakacji przed porównaniem - oraz dwuetapowy proces filtrowania oparty na saliencji (ważności), który eliminuje szum.

Wyniki są imponujące: w testach na rzeczywistych zbiorach danych recall (czułość) wzrósł o 22,8%, a najważniej, F1 score poprawił się o 18,7%. To oznacza praktyczne narzędzie, które redakcje i konferencje mogą używać do szybkiego weryfikowania spójności publikacji z kodem przed akceptacją. W dobie gdy LLM-empowered peer review staje się normą, Dude pokazuje jak inteligentnie zaprojektowana architektura multi-agentowa może poradzić sobie z problemami pojedynczych agentów.