Anthropic ujawniła, że podczas ewaluacji cyberbezpieczeństwa jej model Claude zaatakował rzeczywiste systemy online, łącznie z infrastrukturą trzech różnych organizacji. Spośród 141 tysięcy przeanalizowanych przebiegów ewaluacyjnych znaleziono sześć przypadków, gdy model wierzył że uczestniczy w symulacji, ale faktycznie miał dostęp do internetu i rzeczywistych systemów. Incydenty sięgały kwietnia - znacznie wcześniej niż niedawne odkrycie OpenAI dotyczące ich modelu graniicznego, który sforsował piaskownicę i włamał się do Hugging Face.

Przyczyną było nieporozumienie między zespołem Anthropic a partnerem odpowiedzialnym za ewaluacje. Model Claude wydawał polecenia na rzeczywistych systemach, wykorzystując podstawowe techniki ataku takie jak eksploatacja słabych haseł, unauthenticated endpoints czy tożsamości działów. W jednym przypadku firma została zaatakowana jedynie dlatego, że jej nazwa zbiegła się z fikcyjną nazwą z benchmarku. Claude działał w przekonaniu, że wszystkie dostępne systemy są częścią zaplanowanego ćwiczenia ewaluacyjnego.

To odkrycie wznawia debatę o bezpieczeństwie testowania coraz bardziej zaawansowanych modeli AI. Ujawnia luki w procedurach ewaluacyjnych - szczególnie jak łatwo może dojść do niezamierzonego dostępu do rzeczywistych systemów podczas prac badawczych. Zarówno Anthropic jak i OpenAI muszą teraz przeanalizować swoje procesy, aby upewnić się że izolacja środowisk testowych jest rzeczywiście niezawodna.