Zespół badawczy opublikował LongNovel, nowy benchmark specjalnie zaprojektowany do badania halucynacji w długocontekstowym podsumowaniu powieści. Problem polega na tym, że mimo znacznego rozszerzenia okien kontekstu w modelach AI, systemy wciąż generują błędne lub zmyślone informacje przy streszczaniu dużych tekstów.
Dlatego właśnie powieści okazały się lepszym materiałem badawczym niż artykuły naukowe czy wiadomości - zawierają znacznie bardziej zawiłe opisy zdarzeń, dialogi postaci i bogatą narrację, co umożliwia głębokie badanie fenomenu halucynacji. LongNovel zbudowano z 29 chińskich powieści wahających się od 16 do 100 tysięcy tokenów oraz z rozdziałów z publicznego datasetu BookSum. Badacze wskazali osiem odrębnych typów halucynacji i wykorzystali kombinację Multi-Model Arbitration oraz Entity-Referenced Hallucination Generation, aby wygenerować realistyczne dane o zbilansowanej dystrybucji typów błędów.
Zespół ręcznie zweryfikował wszystkie dane testowe, aby zagwarantować ich niezawodność. Wyniki eksperymentów pokazują, że LongNovel stanowi wyzwanie dla współczesnych modeli - co oznacza, że benchmark jest dobrze skalibrowany. Badanie ma kluczowe znaczenie dla poprawy niezawodności systemów AI pracujących na długich kontekstach, zwłaszcza w zadaniach wymagających precyzji i wierności wobec źródła.