Naukowcy z arXiv badali problem odzyskiwania dowodów uzasadniających decyzje, gdy w procesach recenzyjnych zapisywane są tylko werdykty bez ręcznego oznaczenia fragmentów tekstu, które za nimi stoją. Eksperyment przeprowadzili na zbiorze ContractNLI, gdzie fragmenty uzasadniające przechowywane były wyłącznie do ewaluacji, nigdy do treningu.

W badaniu porównano dwie metody post-treningowe oparte wyłącznie na werdyktach. Label-only training - bezpośredniego treningu na bare verdict - osiągnął dokładność werdyktu 0.896 oraz F1 dla odzyskanych fragmentów 0.564, z poprawą verbatim citation z 0.597 do 0.729. Rejection sampling, która zatrzymuje wygenerowany ślad jedynie gdy jego werdykt zgadza się z zapisanym, a następnie wybiera jeden na podstawie automatycznego scoringu ugruntowania źródła, uzyskał 0.797 dla dokładności i 0.556 dla F1, z verbatim citation na poziomie 0.701.

Klucze spostrzeżenie: zgoda co do werdyktu i zgodność z rzeczywistymi fragmentami to nie to samo. Across sześć badanych systemów obie metryki były słabo skorelowane i klasyfikowały systemy inaczej, co oznacza, że sama dokładność jest niedostatecznym wskaźnikiem, gdy cytowania muszą być sprawdzalne dla człowieka. Obydwie metody istotnie podniosły jakość dowodów bez jakichkolwiek ręcznych adnotacji, co ma praktyczne znaczenie dla przepływów pracy, gdzie koszt zaznaczenia fragmentów znacznie przewyższa koszt zapisania decyzji.