Badacze z arXiv opracowali metodę obrony modeli językowych przed abliteracją - techniką polegającą na usuwaniu zdolności do odmowy poprzez rzutowanie macierzy wag ortogonalnie do wyekstrahowanego kierunku odmowy. Problem w tym, że dotychczasowe metody obrony skupiały się na następstwach zamiast na pierwotnej przyczynie - niezbyt trudnym wyekstrahowaniu samego sygnału odmowy.
Proponowana metoda AMRA działa inaczej. Zamiast czekać na atak, zaciemnia sygnał odmowy już w modelu poprzez zastosowanie aktualizacji niskiego rangu do macierzy zapisujących strumień rezydualny, jednocześnie zastępując aktywacje indukujące odmowę losowymi aliasami. Kluczowe jest to, że inne macierze czytające są korygowane, aby zachować oryginalną funkcjonalność modelu - użytkownik nie powinien zauważyć degradacji wydajności.
Wyniki pokazują znaczną poprawę. Na Llama-3-8B metoda zwiększyła wyniki odmowy po ataku o 2,16 punktu przy prawie niezauważalnym spadku wydajności na teście MMLU (poniżej 0,5 punktu procentowego). Na Gemma-2-9B poprawy są jeszcze bardziej dramatyczne - 14,70 punktu przy utrzymaniu podobnych wskaźników szkodliwych wyników. Chociaż cena za to jest wyższa w odniesieniu do ogólnej użyteczności modelu, podejście to wyznacza nowy kierunek w obronie przed zaawansowanymi technikami agresji na modele AI.