Naukowcy z nowej pracy arXiv opracowali CLAIR-Fin - system dziewięciu współpracujących agentów zaprojektowany do eliminacji halucynacji w złożonych pytaniach finansowych opartych na tekście i obrazach. Kluczowa innowacja polega na weryfikacji każdego pojedynczego twierdzenia przed ostateczną odpowiedzią, a nie tylko sprawdzeniu całego raportu na koniec.
Szczególnie istotne dla praktyki są cztery mechanizmy: Asymmetric Evidence Authority traktuje dowody z tabeli lub wykresu inaczej niż zwykły tekst zależnie od typu pytania, Chain-of-Custody Verification sprawdza ścieżkę poparcia faktów w punkcie przejścia między redakcją a recenzją, Adaptive Rebuttal Cycle automatycznie pogłębia debatę między agentami dla spornych twierdzeń, a Hallucination Risk Index ciągle monitoruje, które fakty rzeczywiście przeszły weryfikację. Testy na zbiorze 500 pytań opartych na raportach Bangladesh Bank wykazały wzrost wiarygodności odpowiedzi z 0,780 do 0,889, przy czym system wstrzymał się od odpowiedzi na 5,4 procent pytań gdy dowody były niedostateczne.
To rozwiązanie istotne dla branży finansowej, gdzie hallucynacje mogą prowadzić do decyzji na miliony dolarów. Tradycyjne systemy RAG bez tego rodzaju wielopoziomowej weryfikacji mogą bezpiecznie brzmieć źle, ale być całkowicie zmyślone. CLAIR-Fin najpierw rozbija problem na czynniki pierwsze, sprawdza każdy z nich osobno przez debatę, a dopiero wtedy buduje ostateczną odpowiedź.