Activation steering - technika enkodująca pożądane zachowanie bezpośrednio w wagi modelu - przetrwa fine-tuning na poziomie mechanicznym, ale jego skuteczność behawioralna zależy całkowicie od danych treningowych. Zespół badaczy przeanalizował pięć instruction-tuned modeli o rozmiarze 3B-14B, testując stabilność embedded steering pod wpływem SFT i RLHF, mierząc zarówno zmianę zachowania jak i zmianę wag.
Klucze znalezienie brzmi paradoksalnie: podczas gdy steering do refusal suppression tracił aż 64 procent efektywności przeciętnie w SFT, sam weight edit przetrwał prawie zupełnie nienaruszony. Zespół zmierzył to precyzyjnie - mean vector recovery wynosił zaledwie rho=0.004, a fine-tuning update biegł prawie ortogonalnie do oryginalnego kierunku steering (mean cos theta=0.074). Oznacza to, że gdy zachowanie modelu reweruje do starego sposobu działania, nie dzieje się to poprzez rozmontowanie lub odwrócenie samego mechanizmu steering.
To odkrycie ma poważne implikacje dla alignment work. Embedded interventions okazują się mechanistycznie trwałe ale funkcjonalnie podatne na zmianę - jeśli dane treningowe będą w konflikcie z zaembedowanym zachowaniem, model nie złamie samego mechanizmu, ale raczej nauczy się go omijać lub ignorować. Oznacza to, że bezpieczeństwo alignment zakodowane przed release wymaga ciągłej behawioralnej weryfikacji nawet wtedy, gdy wagi pozostają matematycznie niezmienione.