Anthropic opublikowała raport opisujący przypadki, w których użytkownicy próbowali wykorzystać Claude'a do badań potencjalnie wspierających rozwój broni biologicznej. Firma zatrzymała wiele takich prób w tym roku, dokumentując pięć konkretnych przykładów obejścia zabezpieczeń i maskowania rzeczywistych celów projektów badawczych.
Wśród zatrzymanych prób znalazły się osoby z krajów, których Anthropic zabroniła dostępu do swoich modeli - w tym z Rosji, Chin i Iranu. Naukowcy stosowali różne taktyki, aby wprowadzić system w błąd na temat rzeczywistego zastosowania swoich zapytań, obfuskując szczegóły badań i pytając o problemy w bardziej ogólny czy teoretyczny sposób. Przypadki te pokazują, że mimo istniejących kontroli, determinowani użytkownicy potrafią znaleźć sposoby na obtarcie safeguardów.
Anthropic podkreśliła, że ujawnienie tych przykładów ma na celu zainicjowanie dyskusji w całej branży AI i wśród rządów na temat pojawiających się zagrożeń biologicznych związanych z dostępem do zaawansowanych modeli. Wydźwięk alertu jest jednoznaczny - wraz ze wzrostem możliwości AI, rośnie również potrzeba bardziej zaawansowanych mechanizmów bezpieczeństwa i międzynarodowej kooperacji w monitorowaniu potencjalnego niewłaściwego użytku technologii.