Badacze z arXiv zaproponowali nowy framework dla agentów LLM, które mogą się samozmieniać i dostosowywać do zmian w regułach, ale bez możliwości modyfikacji wag modelu - jedyną zmienną powierzchnią jest runtime harness zawierający instrukcje, logikę wywoływania narzędzi i kompozycję elementarną. To rozwiązanie rozwiązuje kluczowy problem: agent, który przepisywałby sam siebie, zniszczyłby każdą dokumentację zmian, wyniki testów i ścieżkę audytu potrzebne nadzorcy do zatwierdzenia zmian.
System oparty na tej zasadzie wykorzystuje dual-loop engine z admission gate, który zapisuje łańcuch haszowany rejestrów przed wdrożeniem. W testach symulacyjnych przeprowadzonych na trzech rodzinach reinterpretacji nadzorczych obejmujących 10 eksperymentów na każdym poziomie zagrożenia, gate zaakceptował jedynie 144 z 7449 proponowanych zmian. Żadna z zaakceptowanych zmian nie pogorszyła błędów na danych testowych, a system przywrócił wskaźnik fałszywych alarmów do poziomu oraculum bez zwiększania pominięć we wszystkich wariantach niskiego i średniego ryzyka.
Kontrast jest wymowny: gdy naukowcy zastąpili bramkę konwencjonalnym sprawdzaniem (oparte na mniej widocznych błędach w ostatnich śladach), ten nieograniczony system zaakceptował 309 szkodliwych zmian i pozostawił wskaźnik pominięć powyżej 10 procent w 49 ze 100 przebiegów. Badanie sugeruje, że dla systemów AI operujących w regulowanych środowiskach finansowych, ograniczenie zmian do warstwy runtime z silnym gatekeepingiem może być niezbędne do utrzymania bezpieczeństwa i przejrzystości.