Naukowcy prezentują framework do weryfikacji akcji przed ich wykonaniem przez agentów LLM, rozwiązując problem niemych błędów - akcji, które nie generują błędów, ale produkują błędne wyniki. Dla poleceń shell testowani na zbiorze 9930 poleceń i 482 narzędzi weryfikator statyczny wychwytuje 95,8% błędnych akcji przy 10% wskaźniku fałszywych alarmów. Kontrole składni i binarne osiągają zerowe fałszywe alarmy wychwytując połowę wszystkich błędów, podczas gdy sprawdzenie flag jest ograniczone tylko pokryciem tekstu pomocy.

W przypadku edycji kodu badanie na 640 edycjach obejmujących 224 pliki ujawniło krytyczną różnicę między formatami. Formaty zakotwiczone w zawartości, takie jak search/replace i diff, zawodzą czysto i są weryfikowalne. Natomiast formaty zakotwiczone w lokalizacji, oparte na numerach linii lub nazwach funkcji, zawodzą milcząco - przesunięcie o jedną linię psuje 99,1% plików, a edycje po nazwach funkcji trafiają w niewłaściwą funkcję w 12,7% przypadków.

Kluczową innowacją jest polityka selective grounding - odmowy wykonania akcji w razie niepewności. Ta strategia przekształca milczące błędy w błędy możliwe do naprawy, osiągając recall 0,958. Podejście stanowi efektywną formę nadzoru nad agentami, szczególnie ważną dla systemów działających autonomicznie na rzeczywistych systemach.