Badacze z arXiv CS.AI wprowadzili nowy mechanizm o nazwie Outcome Monitors, który rozwiązuje problem niemych awarii narzędzi - sytuacji, gdy agent AI otrzymuje błędną odpowiedź (na przykład cache ze starą stroną błędu lub negatywną ceną) zamiast wyraźnego powiadomienia o awarii. System monitoruje tak zwane outcome contracts - umowy dotyczące tego, jakie rezultaty są oczekiwane.

Monitor pracuje poprzez analizę śladów wykonań zadań aby nauczyć się kontraktów, lub czerpie je z publicznie dostępnych schematów. Kiedy funkcja zwraca wynik, który narusza te warunki, Outcome Monitor nie blokuje rezultatu, ale wystawia paragon zawierający informacje o naruszeniu i listę dostępnych publicznych narzędzi do naprawy. To podejście stało się kluczowe, bo w osobnych testach kontrolnych usunięcie listy narzędzi naprawczych całkowicie wyeliminowało zyski wydajności.

Resultaty są znaczące: w testach z wstrzykniętymi błędami na benchmarku ToolMaze uzupełnienie zadań wzrosło z 10,9% do 28,1% dla czterech modeli z dwóch rodzin dostawców. W tau-bench retail obserwowano wzrost o 12,0-14,0 punktów procentowych na dwóch poziomach. Badacze zaznaczają jednak ograniczenie - system wykrywał tylko 46% błędów spoza słownictwa, na którym został wytrenowany, choć dostarczanie odpowiedzi i sama percepcja kompletności zadania pozostawała bez zmian. Pozostałą otwartą kwestią jest rozszerzenie detekcji poza pierwotny słownik kontraktów.