Hugging Face opublikował analizę pokazującą fundamentalny problem w projektowaniu systemów bezpieczeństwa dla dużych modeli języka - odrucają one całe tematy zamiast eliminować jedynie szkodliwe podzbiory zawartości. Oznacza to, że modele odmówią dyskusji o sensitywnych zagadnieniach (choćby dla celów edukacyjnych, naukowych czy kontekstu historycznego) jedynie dlatego, że część zawartości na dany temat rzeczywiście stanowi zagrożenie.

Problem dotyczy balansowania między zabezpieczeniami a użyteczością. Gdy model odmawia odpowiedzi na temat kryminalistyki, medycyny sądowej czy biologii w kontekście bezpieczeństwa, blokuje też legalne, pożyteczne zastosowania. To analogiczne do postawienia całego budynku pod kwarantanną zamiast izolacji jedynie zarażonego pokoju. Badacze wskazują, że należałoby bardziej precyzyjnie zdefiniować, które konkretne pytania stanowią zagrożenie, a które są uprawnionymi zapytaniami wymagającymi odpowiedzi.

Wniosek niesie istotne implikacje dla przyszłości AI - mniej drastyczne blokady mogą poprawiać zarazem bezpieczeństwo (poprzez bardziej inteligentne radzenie sobie z rzeczywistymi zagrożeniami) i użyteczność. Wymaga to jednak więcej zaawansowanej klasyfikacji contextowej i bardziej wyrafinowanych metod refusal niż obecne binarny system "tak lub nie".