Zespół badaczy zidentyfikował fundamentalny problem w istniejących metodach kompresji KV cache: wszystkie one decydują co zachować tylko na podstawie treściowej istotności dla bieżącego zapytania, pomijając drugi tryb dostępu - sekwencyjny przegląd po pozycji. Ta asymetria prowadzi do zjawiska nazwanego sequential forgetting, gdzie kompresja zachowuje początek sekwencji (np. identyfikator), ale odrzuca jej kontynuację, uniemożliwiając modelowi skopiowanie całej sekwencji werbatim. Problem dotyczy praktycznych zastosowań takich jak retrieval-augmented generation, dokańczanie kodu czy ekstrakcja strukturalnych danych.
KVFetch to framework bez konieczności treningu, który dodaje kanał czasowego przywołania dla każdego kompresora score-based. Działa na zasadzie democji odrzuconych kandydatów do ilościowo kompresowanego "zimnego" poziomu cache'u, detektuje aktywne kopiowanie poprzez monotoniczny pointer odczytu, a następnie prefetchuje pozycyjnych następników do stałych slotów "gorącego" poziomu. Podejście to zachowuje oryginalny budżet cache'u bez wzrostu rozmiaru.
Rozwiązanie ma znaczenie dla skalowania modeli z kontekstami wynoszącymi dziesiątki czy setki tysięcy tokenów. Sekwencyjne zapominanie było dominującym źródłem utraty jakości pod kompresją, opornym na lepsze scoring, większe budżety czy dynamyczne re-scoring. KVFetch stanowi krok w kierunku pełnego wykorzystania obu trybów dostępu cache'u, jednocześnie pozostając niezależny od konkretnego modelu czy architektury kompresji.