Zespół badawczy opublikował NeuronFuzz - białoskrzynkową metodę fuzzing-u do oceny bezpieczeństwa modeli LLM, która bazuje na monitorowaniu aktywacji neuronów bezpieczeństwa zamiast generowania pełnych odpowiedzi.
Dotychczasowe automatyczne metody testowania polegały na ocenie każdego kandydata na jailbreak poprzez wygenerowanie pełnej odpowiedzi modelu i sprawdzenie, czy wpadł w pułapkę. To jest kosztowne obliczeniowo i słabo funkcjonuje dla mocno zabezpieczonych modeli, które konsekwentnie odrzucają większość ataków. NeuronFuzz rozwiązuje to przez SafetyOracle - system, który konwertuje aktywacje specjalnych neuronów ochronnych w ciągły wynik alarmu bezpieczeństwa. Może to być obliczone już podczas fazy prefill, zanim model zacznie generować odpowiedź, co drastycznie przyspieszają całą procedurę.
Framework identyfikuje kompaktowy zbiór neuronów bezpieczeństwa za pomocą szablonów zawierających szkodliwe i nieszkodliwe dane wejściowe, a następnie wykorzystuje gradienty wyniku alarmu do wskazywania, które części zapytania są kluczowe dla bezpieczeństwa. Mutacje kandydatów na ataki generuje model języka, co zapewnia naturalność i kontekstową spójność tekstu. Badacze testowali metodę na 21 modelach tekst i multimodalnych - wyniki mają pokazać, że NeuronFuzz znacznie wydajniej znajduje podatności w wyrównanych modelach LLM.