REAL-Q wprowadza nowy paradygmat kwantyzacji modeli językowych, eliminując kompromis między dokładnością a obliczalną efektywną. Dotychczasowe metody PTQ kwantyzują każdą warstwę za pomocą zamkniętego rozwiązania drugiego rzędu, ale aby pozostać analitycznie podatnym, muszą drastycznie aproksymować globalną stratę - odrzucając powiązania między kanałami i grupując dane wyjściowe. Ponadto zamrażają obliczony Hesjan na całej warstwie, co oznacza, że nie mogą dostosować się do zmian krajobrazu straty w miarę postępu kwantyzacji kolumna po kolumnie.
Nowa metoda unika tych ograniczeń poprzez ukierunkowanie się na end-to-end aligned surrogate globalnej straty, którą następnie uściśla poprzez fine-grained dynamic Block-wise Gradient Descent stosowany po każdym bloku 128 kolumn. Kluczowe innowacyjne elementy to dynamyczne odświeżanie informacji o gradientach w trakcie procesu oraz mechanizm sliding window zapewniający gładkie przejścia między warstwami, co skutecznie mityguje propagację błędów przez całą sieć. Podejście to drastycznie zmienia paradygmat - zamiast rozcieńczać cel dla analitycznej kontroli, REAL-Q bezpośrednio optymalizuje zgodność z całkowitą stratą modelu.
Wyniki na modelach LLaMA-3.1 (wersje 8B i 70B) oraz Qwen3 (zakresy od 0.6B do 32B) w konfiguracji W4A16 pokazują redukcję end-to-end KL divergence do 49% w stosunku do metod state-of-the-art. Oznacza to znaczny postęp w kompresji modeli językowych przy zachowaniu ich zdolności tekstowych, co ma kluczowe znaczenie dla wdrażania LLM-ów w środowiskach z ograniczonymi zasobami obliczeniowymi.