Badacze z arXiv pokazali, że tradycyjne sposoby oceny dużych modeli języków, takie jak BLEU czy perplexity, nie mierzą rzeczywistego rozumienia kontekstu, a jedynie wydajność na poziomie powierzchniowym. Pojawiła się szczególnie wyraźna luka w ocenie systemów odpowiadających na pytania, gdzie odpowiedzi powinny być zakorzenione w kontekście, a nie stanowić zapamiętane sojuszenia.
Team zaproponował nową metodę opartą na grafach wiedzy (KG) i wskaźniku S3KG, który łączy sygnały strukturalne i semantyczne w jeden score. To pozwala sprawdzić, czy model rzeczywiście wyodrębnia istotne informacje z kontekstu, integruje je w spójną reprezentację wewnętrzną i rozumuje nad nimi, aby wytworzyć odpowiedzi faktycznie poprawne i zakorzenione w kontekście.
Na dziewięciu benchmarkach S3KG osiągnęło wyniki o 7,6 punktu wyższe w metryce F1 od dotychczasowych najlepszych podejść oraz wspófinansowanie AUROC na poziomie 0,973. Oprócz tego zespół rozwinął ramę do diagnostycznej analizy, która pozwala zidentyfikować i kategoryzować błędy rozumowania na poziomie poszczególnych trójek danych, umożliwiając precyzyjne zrozumienie, gdzie i dlaczego model zawodzi.