Sztuczna inteligencja nie naturalnie odmawia niebezpiecznych żądań - tę umiejętność trzeba jej narzucić poprzez specjalistyczny trening. Kiedy OpenAI testowało swoje najwcześniejsze modele, bez problemów generowały one szczegółowe instrukcje do nieszkodliwych celów, od sposobów zranienia do instrukcji samobójczych. Steven Adler, który pracował nad bezpieczeństwem w OpenAI w latach 2020-2024, wspomina że tamte modele "mówią o wszystkim". Podobnie Ryan McBain z Harvardu obserwował, że wczesne chatboty łatwo generowały odpowiedzi nawet na pytania o sposoby popełnienia samobójstwa.

Współczesne systemy rzeczywiście przechodzą intensywny trening zmuszający je do odmawiania szkodliwych poleceń - od tych dotyczących zatrucia kolegów przez biuro po instrukcje do samookaleczenia. Problem w tym, że odmawianie działa w oparciu o statystyczne podobieństwo do wzorów z danych treningowych, a nie rzeczywiste rozumienie bezpieczeństwa. Każdy prompt sformułowany inaczej lub wystarczająco oryginalnie może obejść te zabezpieczenia.

Główne wyzwanie polega na tym, że bezpieczeństwo modeli opiera się na sztuczce: modelom uczą się przeskoczyć pewne rodzaje żądań, ale nie rozumieją fundamentalnie, dlaczego te żądania są niebezpieczne. To powoduje, że nasze zaufanie do "zdolności AI do mówienia nie" jest iluzyjne. Naukowcy coraz częściej dostrzegają, że tej zdolności nie można traktować jako rozwiązania problemu bezpieczeństwa AI - to zaledwie płytkie patenty, które fałszywie uspokajają nas o kontroli nad systemami.