Anthropic postawiła dużo nadziei na tryb auto Claude Code jako ochronę przed atakami prompt injection. Ostatnio uczynili go domyślnym i złożyli śmiałe oświadczenia o jego skuteczności. Johann Rehberger, jeden z najbardziej wiarygodnych badaczy prompt injection, znalazł jednak atak na ten system, który zadziała w 80 procentach przypadków.

Atak polega na oszukaniu Claude Code do pobrania i rozpakowania archiwum zip, a następnie wykonania kodu importującego base64. Trick polega na tym, że biblioteka znajduje się wewnątrz rozpakowanego archiwum jako lokalny plik struct.py, który zostaje załadowany zamiast oryginalnego. To pozwala na niewidoczne dla systemu wykonanie złośliwego kodu. W niektórych przypadkach Claude wykrył kompromis, ale tryb auto zablokował polecenie czyszczące, uniemożliwiając agentowi wyeliminowanie zagrożenia.

Największym problemem jest fakt, że mechanizm bezpieczeństwa sam stał się źródłem problemu - classifier pozwolił na tworzenie złośliwych procesów, ale następnie zablokował komendy mające je wyeliminować. Rehberger rekomenduje uruchamianie niezastrzeżonych agentów kodowania wyłącznie w piaskownicy - kontenerze, maszynie wirtualnej lub sandboxie systemu operacyjnego z ograniczonym dostępem do sieci, bez możliwości dostępu do katalogów użytkownika, kluczy SSH czy danych uwierzytelniających chmury.