Zespół badawczy zaprezentował Praxę - system kontroli dla agentów AI, który wyraźnie dzieli proces wykonywania zadań na pięć oddzielnych stanów: propozycji, autoryzacji, wysyłki, weryfikacji efektu i ostatecznego zatwierdzenia. Podejście to ma na celu rozdzielenie tego, co agent proponuje, od tego, co faktycznie może zrobić i co faktycznie zrobił.

Testowanie przebiegało w czterech etapach. Autorskie audyty w lokalnym repozytorium wykazały stuprocentową zdawalność 1027 testów jednostkowych i 89 testów Workerd, z instrumentacją wszystkich 363 oczekiwanych plików źródłowych. W pilotażu Terminal-Bench Core 0.1.1 na 12 wyselekcjonowanych zadaniach zarówno wariant bazowy jak i warstwa niezawodności przeszły 17 z 36 ścisłych prób. System niezawodności zużywał jednak o 37,49 procent więcej tokenów wejściowych i 50,73 procent więcej wyjściowych.

Trzecia faza badań porównała wariant bazowy z kandydatem Praxy w kontrolowanym środowisku. Obie wersje ukończyły wszystkie 180 prób z równą dokładnością i zerowym naruszeniami ochrony, ale kandydat zużył o 37,11 procent mniej tokenów i osiągnął o 33,84 procent niższe szacunkowe koszty. Chociaż wyniki wskazują na potencjał redukcji kosztów operacyjnych, zespół ostrożnie zaznacza, że nie dowodzą to ulepszonej jakości, opóźnieniach ani rzeczywistym zachowaniu produkcyjnym.