Naukowcy zaproponowali V-Steer, metodę działającą w czasie wnioskowania, która przywraca uprzywilejowaną kontrolę nad zachowaniem modelu poprzez edycję buforowanych wektorów wartości na pozycjach promptu. Problem, który rozwiązuje, jest fundamentalny dla bezpieczeństwa LLM-ów: hierarchia instrukcji zakłada, że systemy powinny najpierw słuchać prompts systemowych, dopiero później poleceń użytkownika czy narzędzi. Jednak najnowocześniejsze modele jak GPT-4 czy Claude często tego nie robią.
Metoda wykorzystuje bezpośrednią atrybuję logitów do pierwszego tokenu predykcji, by zidentyfikować głowy uwagi, gdzie instrukcje niskiego priorytetu dominują nad uprzywilejowanymi. Następnie wzmacnia uprzywilejowane zakresy tekstu i tłumi konfliktujące części poprzez mnożnikowe edycje tensorów V w cache. Kluczowa zaleta: V-Steer nie wymaga retreniniu - działa tylko na już załadowanym modelu, pozostając kompatybilna z szybkimi backendami uwagi.
Na kontrolowanych benchmarkach testujących konflikty ról metoda podnosi dokładność z poniżej 18 procent do 92 procent. Działa na modelach od 7B do 70B parametrów i prze wypadkach pięciu czterech skal konkuruje z metodami wymagającymi treningu. Dodatkowy narzut obliczeniowy ogranicza się do jednorazowego prefill, bez istotnego wpływu na szybkość dekodowania. Kod opublikowany na GitHubie.