Badacze zidentyfikowali mechanizm stojący za problem nadmiernych odmów w modelach LLM wyrównanych do bezpieczeństwa. Zamiast tradycyjnych wyjaśnień opartych na statycznym nakładaniu się reprezentacji, zespół przeanalizował dynamiczne konflikty routingu wewnątrz mechanizmu attention transformerów i odkrył, że zestaw wrażliwych głów bezpieczeństwa błędnie reaguje na bezpieczne instrukcje, tworząc patologiczne splątania uwagi które wiążą nieszkodliwe obiekty z semantyką odmowy.
Przedłożone rozwiązanie, Semantic Routing Calibration, jest beztrenigową metodą inferencji działającą poprzez precyzyjną lokalizację i dynamiczne tłumienie tych nadwrażliwych głów bezpieczeństwa na etapie generowania odpowiedzi. Framework wykorzystuje również fuzję logitów z dwoma gałęziami, która pełni rolę regulatora bezpieczeństwa podczas dekodowania następnych tokenów. Podejście zachowuje zdolności bezpieczeństwa modelu jednocześnie przywracając jego zdolność do wiarygodnego wnioskowania.
Eksperymentalne rezultaty pokazują, że SRC efektywnie zmniejsza problem nadmiernych odmów, co stanowi istotne ulepszenie dla praktycznego zastosowania modeli bezpiecznych - szczególnie ważne dla systemów interaktywnych, gdzie zbyt konserwatywna filtracja bezpieczeństwa utrudnia pracę z legitymitymi żądaniami związanymi z bezpieczeństwem i bezpieczeństwem cybernetycznym.