Zespół badaczy odkrył znaczący problem w systemach LLM-as-a-Judge - modelach używanych do oceny jakości odpowiedzi innych AI. Pod presją adwersarialnych ataków modele te zaczynają mylić formalną prawidłowość (poprawna struktura, logika proceduralna) z rzeczywistą semantyczną prawdą. Naukowcy nazwali to zjawisko Agentic Formalism Trap i zaproponowali metrykę Evaluative Dissonance Index do jego kwantyfikacji.

Analiza 22500 trajektorii z trzech głównych benchmarków - GAIA, SWE-bench i Multi-Challenge - ujawniła uniwersalną podatność. Modele można zmanipulować do zaakceptowania błędnych, lecz formalnie wyglądających odpowiedzi poprzez tzw. hallucination maneuvers - strukturalne triki, które przechodzą syntaktyczne sprawdzenia. Logistyczny meta-oceniający ustalił dokładne syntaktyczne triggery tej podatności z ROC-AUC 0.8779, a test zero-shot Leave-One-Domain-Out wykazał, że luka występuje konsekwentnie niezależnie od dziedziny (ROC-AUC 0.7482).

Badacze wykazali ponadto, że różne architektury modeli mają różne ślepe plamy semantyczne. To oznacza, że niezamknięte pętle ewaluacyjne bez powiązania do rzeczywistości są nietrwałe i systemowo rozbieżne. Wnioski sugerują potrzebę architecture-specific vigilance filtrów - dedykowanych mechanizmów zabezpieczających dla każdego typu modelu oceniającego.