FAMPWQ to nowa technika kwantyzacji wag, która pozwala na bardziej efektywne wnioskowanie wielkich modeli językowych na urządzeniach z ograniczonymi zasobami. Zamiast jednolitego zmniejszania precyzji wszystkich parametrów, metoda adaptacyjnie przydziela różne bity różnym warstwom modelu w zależności od ich wrażliwości na kwantyzację.

Kluczową innowacją jest zastosowanie metryki informacji Fishera do pomiaru, jak bardzo każda warstwa wpływa na końcowe wyniki modelu. Następnie algorytm uczenia ze wzmocnieniem automatycznie decyduje, którym warstwom przydzielić więcej bitów, a którym mniej. Takie podejście pozwala uniknąć problemów tradycyjnych metod, które albo stosują jednakową precyzję wszędzie - co prowadzi do dużej utraty jakości - albo używają prostych heurystyk, które nie zawsze trafiają w najbardziej wrażliwe części modelu.

W eksperymentach na 7 różnych modelach i 5 benchmarkach FAMPWQ wykazała znaczącą przewagę. Osiągnęła lepsze wyniki w perpleksji - metryce mierzącej zdziwienie modelu wobec tekstu - aż do 3,39 punktu niżej niż konkurencja. Dokładność wzrosła o maksymalnie 6,87 procent, a w ocenie dokonywane przez sam model wygrała w 76 procentach porównań. To oznacza, że metoda daje rzeczywistą poprawę jakości odpowiedzi, a nie tylko zmniejsza rozmiar modelu kosztem funkcjonalności.