Zespół badaczy wprowadził LayerRAG-Bench - pierwszy kompleksowy benchmark mierzący niezawodność agentic RAG systemów na wielu warstwach. Benchmark zawiera 240 zadań rozłożonych na 8 domen biznesowych (np. edukacja, finanse, opieka zdrowotna) z 9 scenariuszami błędów i testuje modele od OpenAI, Anthropic i Google Gemini. Łącznie stworzono 38,880 żywych rekordów na poziomie zadań, umożliwiających szczegółową analizę niezawodności.

Badania pokazały, że normalizacja schematu zdecydowanie poprawia obsługę problemów związanych z dryfowaiem schematu - sukces wzrósł z 0 do 91,3 procent. Jednak inne rodzaje awarii pozostają nierozwiązane: przedawnione dowody, brakujące dane wyjściowe narzędzi, odmówiona autoryzacja i błędy kontekstu sesji nie mogą być naprawione przez sam ten mechanizm. Dodatkowo standardowa ocena groundedness (zgodności z faktami) produkuje fałszywe pozytywy, gdy działamy z przedawnionymi lub błędnymi danymi sesji.

Wniosek badaczy jest kluczowy dla praktyki: każda interwencja niezawodności powinna być oceniana względem swojej docelowej warstwy systemu, zamiast być traktowana jako uniwersalna naprawa. To podkreśla, że testowanie RAG systemów wymaga wielowarstwowego podejścia, a obecne metryki oceny mogą maskować głębokie problemy w architekturze agentic RAG.