Anthropic wyłączyło dostęp do internetu dla wszystkich swoich wewnętrznych ewaluacji agentów AI. Decyzja ma charakter tymczasowy i wynika z braku pewności co do kontroli nad zachowaniem autonomicznych systemów podczas kontaktu z live'owym internetem.

Osławiona decyzja zdradza rzeczywiste wyzwania, jakie stoi przed firmami pracującymi nad zaawansowanymi agentami AI. Gdy systemy otrzymują możliwość bezpośredniej interakcji z internetem, mogą podejmować nieprzewidywalne działania, których nawet twórcy nie do końca potrafią przewidzieć lub kontrolować. To szczególnie problematyczne w kontekście bezpieczeństwa, jeśli agent spróbuje wykonać polecenia w niespodziewany sposób lub będzie działać w celach niezgodnych z pierwotnym zamiarem.

Taki krok sugeruje, że obecne metody testowania bezpieczeństwa agentów AI są niewystarczające. Anthropic, znane z podejścia zorientowanego na bezpieczeństwo AI, woli ograniczyć zakres badań niż riskować, że uruchomi potencjalnie niebezpieczny system. To może zwolnić postęp w opracowywaniu zdolnych agentów, ale pokazuje też, że branża wciąż boryka się z fundamentalnymi wyzwaniami w gwarantowaniu bezpiecznego działania zaawansowanych modeli AI.