Badacze z serwisu scalex.dev przeprowadzili eksperyment polegający na testowaniu zdolności ludzi do wykrywania zagrożeń bezpieczeństwa podczas zatwierdzania poleceń wydawanych przez agentów AI. W przeanalizowanym zbiorze 40 tys. przebiegów gry okazało się, że ludzie opuszczali średnio jedną na trzy potencjalne zagrożenia, zatwierdzając akcje agentów bez zwrócenia uwagi na problematyczne elementy.

Badanie ujawnia fundamentalny problem w architekturze systemów AI wymagających ludzkiego nadzoru. Podczas gdy firmy wdrażające agentów AI zakładają, że człowiek będzie działać jako gwarancja bezpieczeństwa, praktyka pokazuje znacznie inne rezultaty. Użytkownicy mogą być zmęczeni procesem zatwierdzania, nie mają wystarczającej wiedzy do oceny ryzyka lub zwyczajnie przeoczyć niebezpieczne aspekty polecenia AI. Zjawisko to znane w psychologii pracy jako fatigue decision-making może być szczególnie problematyczne w systemach krytycznych dla bezpieczeństwa.

Wyniku mają poważne konsekwencje dla przyszłości autonomicznych agentów AI. Jeśli ludzi nie można polegać na niezawodne wykrywanie zagrożeń nawet w kontrolowanym środowisku testowym, pytanie o bezpieczeństwo agentów w produkcji staje się jeszcze bardziej pilne. Badanie wskazuje na konieczność opracowania bardziej zaawansowanych systemów automatycznego wykrywania anomalii lub lepszych interfejsów do prezentowania ryzyka użytkownikom.