Duże modele językowe wykazują znacznie słabsze gwarancje bezpieczeństwa w językach niskozasobowych i ustawieniach wielojęzycznych w porównaniu z wysokozasobowymi. Naukowcy przeanalizowali 50 istotnych prac naukowych z wykorzystaniem metodologii PRISMA 2020, skupiając się na czterech obszarach: metodach wyrównywania bezpieczeństwa, ryzykach wielojęzycznych, benchmarkach oceny i transferowalności między językami. Autorzy zaproponowali taksonomię trzech głównych mechanizmów adaptacji: dostosowania danych, optymalizacji celów i wyrównywania mechanistycznego.

Kluczowe odkrycia ujawniają poważne braki w obecnym podejściu. Przetłumaczone angielskie benchmarki nie odzwierciedlają wystarczająco zakorzenione kulturowo szkody, a modele wielojęzyczne są szczególnie podatne na ataki cross-lingwalne, exploity wykorzystujące code-switching i degradację bezpieczeństwa w niedoreprezentowanych językach. Wiele języków afrykańskich w ogóle nie posiada wyspecjalizowanych benchmarków bezpieczeństwa.

Problem ma głębokie przyczyny: nierówne pokrycie wielojęzyczne w etapie wstępnego trenowania, niewystarczające dane preferencji w językach natywnych, słaba transferowalność reprezentacji bezpieczeństwa między językami i brak ram oceny wrażliwych na specyfikę kulturową. Autorzy wskazują, że rozwiązanie wymaga bardziej inkluzywneg podejścia do bezpieczeństwa modeli, które nie tylko przetłumaczy istniejące benchmarki angielskie, ale opracuje właściwe dla każdej wspólnoty lingwistycznej normy oceny.