Zespół badawczy zaproponował nową metodę trenowania dla systemów odpowiadających na pytania wieloskokowe, które uczą się precyzyjnie rozpoznawać, kiedy dostępne dowody wystarczają do udzielenia odpowiedzi. Zamiast zawsze próbować odpowiedzieć, modele powinny abstrahować się gdy dowody są niewystarczające lub tylko częściowo wspierają odpowiedź. Problem polega na tym, że w pytaniach wieloskokowych fragmentaryczne informacje mogą łatwo wprowadzić w błąd i sprawić, że fałszywa lub niedostatecznie wsparta odpowiedź wydaje się wiarygodna.
Metoda Evidence Sufficiency Boundary Training pracuje na poziomie pokolenia tekstu i buduje uporządkowane łańcuchy dowodów z trzech zbiorów danych: HotpotQA, 2WikiMultiHopQA i MuSiQue. Kluczowe jest to, że model uczy się trzech rzeczy: kiedy w ogóle nie odpowiadać, kiedy zacząć odpowiadać gdy dowody stają się wystarczające, i jak utrzymywać stabilną odpowiedź gdy dodaje się redundantne informacje. Metoda łączy nadzór na poziomie etapów łańcucha, margines przejścia oraz ochronę przed utracionym już odwołaniem.
Badacze przetestowali podejście używając modelu Qwen2.5-3B-Instruct z adaptacją LoRA. Wyniki pokazały przewagę zaproponowanej metody: dokładność w rozpoznaniu granicy przejścia wyniosła 0,807 wobec 0,781 dla bazowego systemu, a wskaźnik niepopieranych odpowiedzi spadł do 0,095 wobec 0,101 dla porównania. Model zachował jednocześnie konkurencyjny wynik w miarach ogólnej jakości odpowiedzi. To wskazuje, że oparty na dowodach system odpowiadania może być zarówno selektywny w abstencji jak i dokładny w odpowiedziach, co jest ważne dla praktycznych aplikacji wymagających zaufania.