Inżynierowie prezentują SemKV, nową metodę kwantyzacji cache'u klucz-wartość wykorzystywanego podczas inferenceji długokontekstowych modeli języka. KV cache stanowi wąskie gardło pamięciowe - rośnie liniowo wraz z długością kontekstu - a SemKV osiąga kompresję 6.0x bez utraty jakości, dzięki wykorzystaniu danych z samego modelu do kierowania procesem kwantyzacji.
Kluczowym odkryciem jest zjawisko quality cliff - przeszkoda między 2.0 a 2.322 bitami na wartość, gdzie jednolita kwantyzacja przechodzi z bezstratnej kompresji do drastycznego upadku jakości. To zjawisko pojawia się konsekwentnie w różnych scenariuszach: generowaniu tekstu, dialogach wieloturowych i transferuje się między modelami (testowali na Llama-3.1-8B i Mistral-7B). Powyżej cliff'u osiem różnych wskaźników znaczenia tokenów w modelu okazuje się statystycznie wymienialne, co oznacza że główną zaletą mieszanej precyzji jest interpolacja między dostępnymi poziomami bitów, a nie wybór ważnych tokenów.
Metoda SemKV zachowuje każdy token, rankuje je według wewnętrznego wyniku modelu i przypisuje dwie sąsiadujące precyzje powyżej cliff'u. Rezultaty pokazują 6x redukcję magazynowania z zerową statystycznie wykrywalną różnicą wobec pełnego FP16 (900 testów z trzema seeds), przewyższając strategie pruningowe tokenów. Używając alternatywnego kwantyzera (TurboQuant-MSE) optymalizowanego pod dystrorsję, naukowcy obniżają cliff, osiągając 7.9x kompresję przy utrzymaniu jakości.