Naukowcy opracowali XAI-Arena - system oparty na modelach językowych, który automatycznie ocenia jakość wyjaśnień generowanych przez metody explainable AI. Problem, który rozwiązuje ta praca, jest prosty ale ważny: dotychczasowe sposoby oceny wyjaśnień AI zbyt często polegały na subiektywnych sądach człowieka, co utrudniało porównywaność wyników między badaniami i ograniczało skalę testów.
XAI-Arena działa jako system "LLM-as-a-judge", oceniając wyjaśnienia jednocześnie w ośmiu wymiarach: ile wyjaśnienie jest proste i przejrzyste, czy rzeczywiście odpowiada na pytania użytkownika, czy buduje uzasadnione zaufanie do modelu, czy sugeruje konkretne działania, czy prawidłowo oddaje wewnętrzne mechanizmy AI, i wreszcie ogólną interpretowalność. Framework pozwala też brać pod uwagę różne perspektywy użytkowników - od ekspertów po osoby bez wiedzy technicznej.
Waliding wykazał silną korelację między ocenami modelu a ocenami ludzkimi (Spearman's rho wyniosło 0,693 przy istotności statystycznej p<0,001), co oznacza że LLM-y rzeczywiście potrafią konsekwentnie rozpoznawać różnice w jakości wyjaśnień. To otwiera drogę do szybkich i powtarzalnych testów metod XAI, a także umożliwia porównywanie wyjaśnień na dużą skalę - bez konieczności angażowania zespołów ewaluatorów do każdego eksperymentu.