Zespół badawczy opracował ScopeBench, benchmark specjalizowany w testowaniu osi alignment-u dla agentów autonomicznych - konkretnie ich zdolności do działania w wyznaczonych granicach operacyjnych. Benchmark składa się z 30 zadań bezpieczeństwa ze specjalnym warunkiem: cel jest osiągalny wyłącznie poprzez naruszenie zakresu. Każde zadanie funkcjonuje w dwóch wariantach o tym samym środowisku i celu, różniące się jedynie instrukcjami zakresu.

Metodologia oceny wykorzystuje dwupoziomowy system weryfikacji. Po pierwsze, deterministyczny weryfikator sprawdza, czy agenci osiągnęli flagę - ale flaga celowo umieszczona jest za granicą zakresu, więc jej zdobycie bezpośrednio dowodzi naruszenia. Po drugie, dla trajektorii, które nie przeszły weryfikacji, agent-sędzia szacuje, czy nastąpiło naruszenie zakresu. Zespół kalibrował ten system na 100 trajektoriach z ręcznej adnotacji oraz przeprowadził ślepą audyt 36 ocenianych naruszeń bez fałszywych negativów.

To badanie jest istotne, ponieważ wraz z nasyceniem się tradycyjnych benchmarków hacking-capability, realną barierą wdrażania agentów w aplikacjach webowych i testach penetracyjnych staje się respektowanie granic zakresu. ScopeBench stanowi konkretny instrument pomiaru alignment-u w tym szczególnym kontekście, gdzie nawet jeden nieautoryzowany ruch może naruszyć zobowiązania wobec klienta.