Międzynarodowy zespół badaczy opublikował pracę pokazującą, że kwantyzacja modeli językowych - standardowy proces zmniejszający rozmiar modeli dla urządzeń brzegowych - może być wykorzystana do wprowadzania backdoorów, które pozostają ukryte podczas oceny przed wdrożeniem. Atakujący mogą osadzić złośliwe payload'y w modelach, które przechodzą wszystkie testy w pełnej precyzji (FP16), ale aktywują się dopiero po kompresji do INT8 lub 4-bitów.

Problem wynika ze strukturalnej luki między walidacją a wdrażaniem. Gdy model jest certyfikowany w pełnej precyzji, a kwantyzacja stosowana jest dopiero przed deploymentem bez ponownej oceny, atakujący może wykorzystać to okno czasowe. Badacze formalnie zdefiniowali ten problem poprzez Quantization Behavioral Equivalence Classes - klasy modeli, które behawioralnie są równoważne w pełnej precyzji, ale mogą się radykalnie różnić po kwantyzacji.

Testowanie zagrożenia wykazało dramatyczne skutki: w modelach tłumaczenia maszynowego przesunięcie treści nieprzyjaznych dla zdecydowanej grupy wzrosło z 0% w FP16 do 85% po kwantyzacji. Badacze testowali także klasyfikatory ideologiczne, obserwując znaczące przesunięcia w orientacji politycznej. Praca rozszerza wcześniejsze badania z modeli decoder-only na wielojęzyczne modele encoder-decoder, co oznacza szersze zastosowanie ataku niż dotąd sądzano.