Naukowcy opracowali DAMP (Decay-Aware Mixed-Precision), pierwszą metodę post-training kwantyzacji dla stanów rekurencyjnych w modelach języka używających Gated DeltaNet i Kimi Delta Attention. Te nowsze architektury zastępują tradycyjny KV cache - który rośnie liniowo z długością sekwencji - stałymi stanami rekurencyjnymi, ale te stany przechowywane w pełnej precyzji FP32 nadal zużywają znaczną część pamięci GPU i przeszkadzają w szybkości inference'u.
Kwantyzacja jednolita nie sprawdza się w tym przypadku: już INT8 i FP8 zauważalnie degradują dokładność na złożonych zadaniach rozumowania, a INT4 prawie całkowicie ją niszczy. Zespół odkrył jednak, że błędy kwantyzacji skupiają się w małej liczbie kanałów oraz że względna siła rozpadu stanów pozostaje stabilna niezależnie od promptu czy zadania. Na tej podstawie DAMP identyfikuje kanały wysokiego ryzyka podczas offline'owej kalibracji, stosując zarówno analizę energii błędu jak i ocenę trwałości opartą na rozpadu.
Rozwiązanie przechowuje kanały krytyczne w wyższej precyzji, a pozostałe w INT8, osiągając efektywnie 9,9 bitu na wartość stanu. Testy na modelach Qwen3.6-35B i Kimi-Linear-48B wykazały, że metoda utrzymuje dokładność bliską oryginałowi na sześciu benchmarkach obejmujących rozumowanie matematyczne, logiczne oraz generowanie kodu. To ma praktyczne znaczenie dla deploymentu dużych modeli na GPU z ograniczoną pamięcią.