Badacze z arXiv identificowali krytyczny problem w automatycznym diagnozie awarii agentów AI: istniejące metody oparte na LLM-ach osiągają niską dokładność diagnostyczną, szczególnie gdy ślady wykonania się wydłużają. Chodzi tu o zjawisko zwane root-cause attribution (RCA) - automatyczne znalezienie pierwotnej przyczyny niepowodzenia w masywnych logach wykonania.

Problem polega na tym, że istotne informacje w długich sekwencjach akcji są rozproszone, odległe od widocznej awarii i pozostają źle połączone. Dotychczasowe metody RCA opierały się na jednokrotnym osądzie LLM - model analizuje log, wyciąga wstępne wnioski i często zatrzymuje się na pierwszej wiarygodnej diagnozie, ignorując dalsze ślady mogące ujawnić rzeczywistą przyczynę. Naukowcy wprowadzili ramę Continual Search, która iteracyjnie "popycha" model LLM do ponownego przeszukiwania śladów w kolejnych turach, systematycznie odkrywając nowe dowody diagnostyczne.

Ewaluacja metody objęła cztery istniejące benchmarki RCA, ale zespół dostrzegł brak długich śladów wykonania w obecnych testach. W odpowiedzi stworzyli MegaRCA-Mix - nowy, ambitny zbiór testowy zawierający 50 ręcznie anotowanych prób awarii z zadań wymagających długiego horyzontu działania i intensywnego logowania. Tego rodzaju ujęcie problemu RCA jako masowego zadania wyszukiwania to istotny krok w kierunku bardziej niezawodnej diagnostyki awarii systemów AI na produkcji.