Naukowcy z arXiv zaprezentowali DeReAct, modułową architekturę agentów, która rozwiązuje kluczowy problem obecnych systemów opartych na ReAct. Tradycyjne agenty ReAct używają jednego modelu do wszystkiego: proponowania akcji, interakcji ze środowiskiem i decydowania o zakończeniu. Takie połączenie skutkuje brakiem niezależnej kontroli nad autoryzacją akcji i potwierdzeniem zakończenia, co pozwala błędom się rozprzestrzeniać i prowadzi do niewiarygodnych oświadczeń o ukończeniu zadania.
DeReAct rozwiązuje to poprzez externalizację dwóch niezależnych polityk sterowania. Critic ocenia proponowane akcje zanim zostaną wykonane, a Context Manager rekonstruuje stan wspierany przez środowisko i certyfikuje faktyczne ukończenie zadania. W praktyce oznacza to, że agentowi brakuje możliwości samowolnego stwierdzenia sukcesu - zewnętrzne bramy wymuszają weryfikację. W eksperymentach na GAIA i SWE-bench Verified system przyniosł znaczne zyski dla słabszych modeli: 6,5-7,0 punktów dla Qwen3-Coder-480B i 4,2-5,2 punktów dla Claude Sonnet 4.5 w metryce Pass@1. Jednak korzyści zmniejszają się wraz z rosnącą mocą modelu głównego.
Analiza trajektorii pokazuje, że zewnętrzne bramki działają najlepiej, gdy rzeczywiste błędy są częste i sama polityka sterowania jest wystarczająco zdolna. Interesujące, że z Claude Opus 4.5 DeReAct utrzymuje porównywalną wydajność do standardowego ReAct, ale generuje trajektorie o lepszym ugruntowaniu w faktach i bardziej przestrzegające ograniczeń. To sugeruje, że kontrola ukończenia może wymienić wcześniejsze zakończenie na mocniejsze zakotwiczenie w rzeczywistości.