Zespół badawczy przeanalizował, w jaki sposób uzasadnienia przesyłane z modułu rozumowania do modułu weryfikacji w systemach odpowiadania na pytania faktycznie wpływają na wyniki. Zamiast patrzeć tylko na końcową dokładność, naukowcy wprowadzili metodę diagnostyczną, która fiksowała dowody i możliwe odpowiedzi, a zmieniała jedynie uzasadnienie przesyłane między komponentami systemu. Testowali to na 400 przykładach z zbiorów MuSiQue, HotpotQA i 2WikiMultiHopQA, używając DeepSeek zarówno jako generatora, jak i werifikatora.
Wyniki były zaskakujące. Wiernie sformułowane uzasadnienia prawie nie zwiększały dokładności odpowiedzi w porównaniu z ich całkowitym brakiem. Jednak zakorumpowane uzasadnienia - zmienione lub niedokładne - drastycznie zmieniały sposób, w jaki model oceniał wiarygodność obsługiwanej wiadomości. W zwykłym wariancie paraphrazy zmieniały ocenę wiarygodności o zaledwie 0-2,5 procenta, podczas gdy zakorumpowane uzasadnienia przesuwały ją o 10-22 procent. Gdy model otrzymywał wyraźną instrukcję do sprawdzania uzasadnień, efekt wzrastał dramatycznie do 34-55 procent. Ostateczne odpowiedzi zmieniały się znacznie mniej - od 2 do 30 procent - a w większości przypadków zmiana oceny wiarygodności nie prowadziła do zmiany ostatecznej odpowiedzi.
Audyt przeprowadzony przez ludzi ujawnił, że 16 z 42 testowanych zakorumpowanych uzasadnień przypadków reprezentowało tendencję do nadmiernego ufania złym uzasadnieniom. Ponad to sami ludzie odrzucali lub oznaczali jako niejasne 9 na 10 zakorumpowanych uzasadnień, które model akceptował. Badanie sugeruje, że uzasadnienia w systemach QA powinny być oceniane nie jako czynnik poprawiający dokładność odpowiedzi, ale jako mechanizm wpływający na ocenę wiarygodności - co podkreśla potrzebę ostrożniejszego projektowania architektur sieciowych opierających się na przekazywaniu takich wiadomości między komponentami.