Badacze zaproponowali OpenEvoShield, framework do ciągłej obrony systemów wieloagentowych opartych na dużych modelach językowych przed atakami poprzez zatrute komunikaty między agentami. Problem polega na tym, że groźby ewoluują - atakujący ciągle ulepszają swoje strategie zastrzyków, a jednocześnie normalne zachowanie systemu zmienia się wraz z jego rozwojem, co sprawia, że statyczne obrony szybko tracą skuteczność.

OpenEvoShield radzi sobie z tym poprzez cztery współpracujące moduły. Pierwszy (M1) kontroler asymetrycznych szybkości uczy się szybko atakującego zachowania, ale wolno naturalnego - to asymetryczne tempo pozwala być zwinnym wobec zagrożeń bez destabilizacji systemu. Drugi moduł (M2) dynamicznie aktualizuje granice normalnego zachowania, trzeci (M3) to ensemble polityk trenowanych z regularyzacją EWC, która zapobiega katastrofalnym zapomnieniom wcześniejszych wiedzy. Ostatni moduł (M4) to detektor opierający się na modelach energetycznych, analizujący zachowania na trzech poziomach - poszczególnych węzłów, podgrafów i całego systemu - aby klasyfikować nowe ataki jako anomalie.

Testy przeprowadzone na pięciu benchmarkach i czterech różnych topologiach systemów wieloagentowych przez 100 rund wdrażania pokazały, że OpenEvoShield przewyższa zarówno statyczne defens jak i inne metody uczenia się ciągłego. Framework skutecznie wykrywa przeważająca większość wcześniej nieznanych ataków, jednocześnie utrzymując niskie wskaźniki fałszywych alarmów. To ważne dla bezpieczeństwa systemów AI wdrażanych w zastosowaniach krytycznych dla bezpieczeństwa, gdzie nieprzewidziane zagrożenia mogą stanowić poważne ryzyko.