NEXUS to nowy system monitorowania bezpieczeństwa dla agentów LLM, który w czasie wykonywania decyduje o każdej akcji - czy ją pozwolić, zablokować, poprosić o potwierdzenie czy poprosić o rewizję. System powstał, bo agenty LLM coraz bardziej wchodzą w świat realnych operacji, od zarządzania bazami danych po interakcje z systemami zewnętrznymi, a każdy błąd czy złośliwa instrukcja mogą mieć poważne konsekwencje.
NEXUS łączy trzy podejścia: deterministyczne reguły bezpieczeństwa, inspekcję argumentów funkcji na poziomie szczegółu, oraz kalibrowany model regresji logistycznej do ocenienia ryzyka. Na syntetycznym benchmarku 128 instancji uzyskał wynik F1 0,949 i dokładność klasyfikacji interwencji 64%, co jest lepsze o 27,3 punktu procentowego od systemów opartych wyłącznie na regułach. Na innych testach - R-Judge, AgentHarm i IPI - wypadł porównywalnie lub lepiej. Mediana opóźnienia wyniosła 0,205 ms, co oznacza prawie zerowy narzut.
Kod, benchmarki i kalibrowany scoring zostały udostępnione publicznie. To praktyczne podejście do problemu, który będzie rosnący - zanim LLM agenty staną się bardziej zaawansowane, systemów takich jak NEXUS będzie potrzeba coraz więcej, żeby zapewnić kontrolę i przewidywalność ich działań.