Naukowcy z arXiv opublikowali PRQuant, framework do kwantyzacji niskobitowej, który kombinuje reorganizację kanałów z kompensacją reszt na stronie wag. Problem, który rozwiązuje, to dominacja małej liczby outlaierów w dokładności kwantyzacji warstw liniowych - istniejące metody takie jak smoothing czy rotacja pomagają, ale wprowadzają nowe problemy z dokładnością wag i działają online, co generuje duże koszty obliczeniowe.

PRQuant działa bez treningu i identyfikuje kanały wejściowe, które najbardziej wpływają na błędy kwantyzacji wag. Po skalowaniu w stylu AWQ, metoda permutuje te kanały do bloku contiguous (ciągłego) i buduje offline sub-tensory reszt wag. Podczas inferencji ta contiguous struktura pozwala aktywacjom korzystać z tail bloków bezpośrednio bez kosztownej operacji online gatheringu, a rozproszoną kompensację reszt zamienia w regularną GEMM z augmentacją tail. To drastycznie redukuje latencję.

Ablacja wykazała, że smoothing i kompensacja reszt to główne czynniki poprawy dokładności numerycznej, podczas gdy permutacja zapewnia marginalną korzyść numeryczną, ale ważniejsze - umożliwia sprzętowo-przyjazny contiguous layout, który eliminuje drogą operacje gather. Podejście nie wymaga treningu, co czyni je praktycznym dla istniejących modeli.