Naukowcy zidentyfikowali nowy rodzaj ataku na systemy agentów AI, zwany atakami kaskadowymi, gdzie złośliwy kod jest rozmyślnie rozprowadzony na wiele umiejętności tak, by każda modyfikacja wydawała się nieszkodliwa z osobna, ale ich łączne wykonanie powoduje szkodę. W przykładzie z praktyki medycznej, pierwsza umiejętność osłabia sygnały dotyczące niedawno wycofanych leków w historii pacjenta, druga zmniejsza powagę interakcji z nimi, a trzecia ukrywa wynikły alert niskiego priorytetu w podsumowaniu - powodując cichy znik poważnego ostrzeżenia przed dotarciem do lekarza.
Problematyka wynika z samej natury nowoczesnych systemów agentów, które wykorzystują otwartty ekosystem umiejętności - modułowych pakietów zawierających instrukcje w języku naturalnym, skrypty wykonywalne i zasoby referencyjne. Podczas gdy elastyczność tego podejścia umożliwia wszechstronne wykorzystanie możliwości trzecich stron, otwiera też niespodziewaną powierzchnię ataku. Dotychczasowe badania bezpieczeństwa skupiały się głównie na lukach w poszczególnych umiejętnościach, ale ignorowały ryzyka wynikające z interakcji między nimi.
W odpowiedzi na to zagrożenie badacze opracowali SkillCascade, zautomatyzowany framework red-teamingowy do testowania wielu agentów, oraz SkillCascade-Bench zawierający 213 zwalidowanych przypadków testowych obejmujących różne systemy agentów i domeny. Testy przeprowadzono na reprezentatywnych platformach, w tym OpenClaw, Claude Code i Codex. Odkrycia wskazują, że to poważna luka w bezpieczeństwie systemów autonomicznych, szczególnie w kontekście aplikacji krytycznych dla życia i zdrowia ludzi, gdzie łańcuchowe interakcje między umiejętnościami mogą w cichy sposób sabotować bezpieczeństwo operacji.