Zespół badaczy odkrył, że halucynacje w modelach języka można wykryć, analizując topologiczne wzorce przepływu informacji w attention graphs - map pokazujących, na które elementy tekstu model zwraca uwagę podczas generowania odpowiedzi. Zamiast tradycyjnych podejść patrzących na einzelne attention heads, nowa metoda bada strukturalne cechy całego grafu, szczególnie poszukując wąskich gardeł informacyjnych za pomocą Forman-Ricci curvature, matematycznego narzędzia opisującego geometrię struktur sieciowych.

Metoda wykazała, że halucynacje konsekwentnie wiążą się z określonymi wadami w przepływie kontekstu między tokenami. Model zaczyna zbyt mocno polegać na samouzupełnianiu się (over-reliance on self-attention), tracąc zdolność do efektywnego odwoływania się do wcześniejszych informacji w tekście. W wielu przypadkach obserwuje się także problem uścisku informacyjnego - gdy zbyt dużo informacji jest wciśnięte do zbyt małej przestrzeni w ostatnich warstwach sieci, uniemożliwiając modelowi prawidłowe przekazanie całego kontekstu.

Ocena przeprowadzona na kilku architekturach modeli i ustanowionych benchmarkach wykazała, że jednoprzebiegowe podejście topologiczne skuteczniej przewiduje halucynacje niż istniejące metody bazujące na analizie attention czy multiples próbkach odpowiedzi. To odkrycie jest ważne, ponieważ pozwala na szybszą i bardziej niezawodną detekcję błędnych generacji modelu w aplikacjach, gdzie dokładność jest krytyczna.