Naukowcy z MIT i innych ośrodków badawczych stworzyli benchmark GraphEcho, który bada fundamentalny problem w agentach opartych na modelach językowych: czy potrafią oni odróżnić nowe dowody od powtórzeń tego samego argumentu przechodzącego różnymi ścieżkami w grafie wiedzy. Badanie pokazuje, że większość testowanych modeli rzeczywiście traci czujność wobec tego zjawiska.
W kontrolowanych eksperymentach przeprowadzonych na syntetycznych danych zespół zmienił liczbę ścieżek do tego samego dowodu, ale trzymał stałą zawartość informacyjną. Wyniki ujawniły istotny problem: agenty miały tendencję do wzmacniania przekonania o wiarygodności twierdzenia wraz ze wzrostem liczby redundantnych ścieżek, co sugeruje, że mylą powtórzenia z niezależnymi potwierdzeniami. Eksperymenty wykazały również, że wszystkie oceniane modele wykonywały więcej powtarzających się przejść, gdy dostępnych było więcej redundantnych ścieżek.
Team zastosował metodę treningu świadomą pochodzenia dowodów (PAPT), która zmniejszyła liczbę powtarzających się przejść i poprawiła dokładność na danych syntetycznych. Jednak ta sama metoda zmniejszyła również liczbę odrębnych źródeł, na które agent zaglądał. Gdy badacze testowali to podejście na rzeczywistych naukowych twierdzeniach, powtórzenia spadły, lecz dokładność oceny dowodów się pogorszyła. GraphEcho ujawnia głęboką przepaść w procesach eksploracyjnych agentów LLM: mogą nauczyć się nie powtarzać siebie, ale jednocześnie mogą pominąć istotne informacje z różnych źródeł.