Modele językowe trenowane na instrukcjach, takie jak Llama-3-8B i Mistral-7B-Instruct, mogą być łatwo manipulowane do wykonywania szkodliwych zadań, jeśli są do nich zwracane w małorozwojowych językach afrykańskich, nawet jeśli w języku angielskim prawidłowo odrzucają takie polecenia. Naukowcy z ArXiv zidentyfikowali, że mechanizm bezpieczeństwa istnieje w wewnętrznych reprezentacjach modelu - tak zwanych residual streams - ale nie aktywuje się dla danych wejściowych w takich językach jak yoruba, igbo, igala czy hausa.

Zamiast wymagać oznakowanych danych treningowych dla każdego języka afrykańskiego - czego nie ma na dużą skalę - zespół opracował metodę zwaną Latent Space Refusal Anchoring (LSR-Anchoring). Podejście to działa podczas inferencji: ekstrahuje kierunek odrzucenia z anglojęzycznych przykładów i wstrzykuje go do wewnętrznego strumienia modelu w czasie rzeczywistym. Główna wariant, Mean-Activation Steering, osiąga zadowalające wyniki na Mistral i Qwen2.5 ze spadkiem wydajności poniżej 0,08 punktu, choć na Llama-3-8B prowadzi do nadmiernej korekty szkodzące szacunkowym pytaniom.

Druga wariant, SAE-Derived Steering, rozwiązuje ten problem poprzez wykorzystanie Sparse Autoencoder do znalezienia pojedynczej cechy zamiast gęstego wektora kierunkowego. Podejście zmniejsza rozbieżność Kullbacka-Leiblera o 3,5-7 razy bez utraty wydajności na prawidłowych pytaniach. Cztery języki transferują się pozytywnie, ale arabski zawodzi na każdej architekturze, sugerując fundamentalną niezgodność geometryczną między językami zamiast problemu z danymi wyjściowymi.