Naukowcy z University of Washington zidentyfikowali precyzyjne mechanizmy odpowiadające za zdolność dużych modeli jezykowych do odmowy generowania szkodliwych treści. Przy użyciu activation steering na czterech otwartych modelach odkryli, że efektywne sterowanie odmową wymaga interwencji zaledwie w 28-48 procentach komponentów sieciowych, zachowując 88-101 procent pełnego efektu behawioralnego.
Badanie ujawnia dwupoziomową strukturę rzadkości w transformerach. Po pierwsze, które komponenty (neurony w warstwach attention i MLP) są kluczowe dla odmowy. Po drugie, nawet w ramach tych wybranych komponentów, tylko około 50 procent wymiarów residual stream faktycznie nosi sygnał sterujący, zachowując 85-98 procent efektywności. Ta hierarchiczna rzadkość sugeruje, że odmowa nie jest rozproszoną właściwością całej sieci, ale ma strukturalny, identyfikowalny fundament.
Wyniki mają znaczenie dla interpretowaności AI i bezpieczeństwa modeli. Zrozumienie, które precyzyjne komponenty kodują bezpieczeństwo, pozwala na bardziej celowane manipulacje behawioralne bez wpływu na inne funkcje modelu. Zespół udostępnił pełny kod i wyniki eksperymentów w repozytorium GitHub, ułatwiając replikację badań i dalsze badania mechanizmów odmowy w transformerach.