Naukowcy z arXiv opracowali framework do weryfikacji wyjść generowanych przez duże modele językowe bez konieczności porównywania ich z referencyjnymi odpowiedziami. Problem polegał na tym, że odpowiedzi AI bywają płynne i przekonujące, ale zawierają błędy w wieloetapowym rozumowaniu - szczególnie trudne do wykrycia w dziedzinach wysokiego ryzyka jak medycyna.

Metoda rozkłada wygenerowany ślad rozumowania na mniejsze segmenty, a następnie etykietuje relacje między przesłankami a wnioskami, używając Natural Language Inference. Te relacje są organizowane w strukturę hipergrafu, którą przeszukuje algorytm AND-OR search. Każdy segment otrzymuje wtedy etykietę wskazującą na jak solidnych podstawach opiera się jego logika. Badacze przebadali framework na dwóch zbiorach: Hard2Verify dla zadań matematycznych oraz UroReason - nowy benchmark oceniony przez lekarzy, zawierający ślady rozumowania LLM z rzeczywistych przypadków klinicznych.

Wyniki pokazały, że podejście oparte na NLI-hipergrafie daje bardziej niezawodny sygnał ewaluacji niż tradycyjne metody, gdzie inne LLM-y pełnią rolę sędziów. W kontekście medycznym obecne najlepsze modele jako weryfikatory regularnie nie dostrzegają problemów w rozumowaniu, akceptując odpowiedzi które brzmią dobrze, ale mają słabe logiczne podstawy. Badanie podkreśla, że ewaluacja odpowiadających systemów powinna uwzględniać, jak relacje wnioskowania łączą się w całe rozumowanie, a nie opierać się tylko na ostatecznej odpowiedzi lub innych LLM-ach. Zespół planuje udostępnić benchmark UroReason przez API oraz opublikować kod jako open source.