Naukowcy z arXiv opublikowali badanie analizujące, jak poprawy w wynikach weryfikacji faktów rozpределają się między odpowiedzi i dowody. Kluczowe odkrycie: na zbiorze FEVEROUS wymiana modelu DCUF na UnifEE podniosła strict score o 9,61 punktu procentowego, lecz tylko 1,96 punktu wynika z poprawy dokładności odpowiedzi - resztę (7,92-9,08 punktu) stanowi lepsza jakość dowodów.
Team przetestował cztery warianty DeBERTa na 7,890 twierdzeniach, a następnie przeprowadził szeroką ewaluację z udziałem dwóch 8B-parametrowych LLM-ów - Qwen i Llama. Na zbiorach FEVER, FEVEROUS i SciFact wygenerowano 470,400 odpowiedzi w różnych konfiguracjach. Kluczowy wniosek: zwiększenie budżetu kontekstu z 256 do 2048 tokenów podniosło wynik weryfikacji faktów przy stałych odpowiedziach o 3,10-3,84 punktu procentowego, w zależności od modelu. Efekty były jednak poniżej wstępnie ustalonych kryteriów cross-datasetowych.
Badanie pokazuje, że tradycyjne metryki dokładności mogą maskować rzeczywiste problemy na poziomie poszczególnych twierdzeń. Analiza post-hoc ujawniła znaczące różnice w tym, jak poszczególne modele radzą sobie z rykoszetem między czystą poprawą odpowiedzi a poprawą pokrycia dowodów. Jest to ważne dla twórców systemów fact-checkingowych, którzy muszą równoważyć inwestycje w generowanie trafnych odpowiedzi i w ekstrakcję kompletnych, wiarygodnych dowodów.