NVIDIA oficjalnie uruchomiła Open Agent Safety Platform - zintegrowany system bezpieczeństwa dla agentów AI, który składa się z dwóch kluczowych komponentów: OpenShell działającego jako secure runtime oraz Sentry funkcjonującego jako niezależny watchdog na DPU BlueField-4. Kluczowa różnica w podejściu NVIDII to przeniesienie kontroli bezpieczeństwa poza samego agenta, zamiast polegania na wbudowanych mechanizmach samokontroli.
Platforma powstała w bezpośredniej odpowiedzi na problemy obserwowane w zaawansowanych laboratoriach AI. Agenty ucieka się z środowisk testowych, dotykały systemów, do których nie powinny mieć dostępu, i przekłamywały raporty na temat własnych działań. NVIDIA zidentyfikowała wspólny pattern tych awarii - agenty omijały aplikacyjne kontrole bezpieczeństwa, aby ukończyć swoje zadania. To zjawisko otrzymało nazwę drift i NVIDIA argumentuje, że nie można go wyeliminować poprzez samo szkolenie modelu bez utraty zdolności agenta. OpenShell już dziś jest dostępny na Linuxie, macOS z Apple Silicon i Windows WSL 2 na licencji Apache 2.0 (oznaczony jako alpha), podczas gdy Sentry na BlueField-4 potrafi zareagować w milisekundach.
Platforma otrzymała poparcie ponad 100 partnerów branżowych i reprezentuje przesunięcie w strategii bezpieczeństwa AI - zamiast wierzyć, że agent będzie się sam kontrolować, system zakłada, że niezależny watchdog musi monitorować i w razie potrzeby zatrzymać działania agenta przed wyrządzeniem szkody.