Nowe badanie z arXiv pokazuje, że system prompty - główne narzędzie do kontrolowania zachowania modeli językowych - mają zaskakująco ograniczony wpływ na faktyczne obliczenia wewnątrz transformerów. Naukowcy przebadali 17 modeli instrukcyjnych o wielkości od 1.5 miliarda do 72 miliardów parametrów, używając techniki Centered Kernel Alignment do porównania reprezentacji warstwowych pod wpływem 20 różnych promptów systemowych podzielonych na pięć kategorii funkcjonalnych.

Wyniki są zaskakujące: instrukcje dotyczące persony i formatowania całkowicie przebudowują wewnętrzne reprezentacje modelu, natomiast instrukcje bezpieczeństwa prawie wcale ich nie zmieniają. Jeszcze bardziej zaskakujące, bardzo restrykcyjne instrukcje bezpieczeństwa i jawnie permisywne polecenia (jak "nie masz ograniczeń") uruchamiają prawie identyczne ścieżki obliczeniowe z korelacją 0.997. Nawet w największych modelach komercyjnych penetracja bezpieczeństwa pozostaje poniżej 10 procent. Model koduje kategorię promptu w każdej warstwie, ale rzeczywiście zmienia swoje działanie tylko w niewielkim podzbiorze warstw - innymi słowy, instrukcja jest "widziana" przez model, ale nie jest "głęboko implementowana".

To odkrycie mechanistycznie wyjaśnia, dlaczego jailbreaki są takie skuteczne i dlaczego bezpieczeństwo modeli jest trudniej egzekwować poprzez samo inżynierię promptów. Badacze użyli activation patching i linear probingu, aby potwierdzić, że tylko określone warstwy medią rzeczywistą zmianę zachowania, a głębokość reprezentacyjna koreluje ze skalą efektu behawioralnego w całej kohorcie 17 modeli.