Zespół badawczy opracował Aegis, system kontroli działań dla agentycznych systemów AI, który wprowadza zaufaną warstwę decyzyjną między modelami a ich wykonaniem. Zamiast pozwalać agentom AI bezpośrednio modyfikować pliki, wysyłać wiadomości czy uruchamiać procesy, system Aegis traktuje te żądania jako propozycje, które muszą zostać zweryfikowane przez niezależny mechanizm przed faktycznym wykonaniem.

Problem bezpieczeństwa agentycznych AI przesunął się z generowania szkodliwych tekstów do potencjalnych niszczących skutków operacyjnych - gdy agent może zmienić stan systemu, usunąć dane czy wysłać wiadomości bez nadzoru. Standardowe prompty kształtujące zachowanie modelu nie tworzą tu wystarczającej granicy bezpieczeństwa. Aegis rozwiązuje to poprzez ocenę każdej proponowanej akcji względem aktywnej polityki bezpieczeństwa, weryfikację jej pochodzenia na serwerze oraz domyślne odrzucanie działań w przypadku niepewności. System wdrażał także Senate-style settlement - mechanizm wymagan quorum wielostopniowego zatwierdzenia dla wrażliwych operacji.

Badania na zbiorze testowym obejmującym 6300 prób wykazały efektywność podejścia. Testy porównawcze tradycyjnych metod generowały 79 niebezpiecznych działań podczas gdy Aegis-rządzone operacje zanotowały zero riskowych akcji. System zachował też pełną kontrolę nad pochodzeniem i audytem każdej decyzji - wszystkie 1832 prób Aegis zachowały sprawdzone pochodzenie, a 1019 akcji osądzonych przez Senate miało dokumenty quorum i podpisy. Wyniki pokazują, że runtime governance może być praktycznym podejściem do kontroli działań agentów AI, choć badania były prowadzone w kontrolowanym środowisku testowym.