KVBoost to nowy system przyspieszający wnioskowanie transformerowych dużych modeli językowych przez inteligentne ponowne użycie buforów kluczy i wartości na poziomie fragmentów tekstu. Dotychczasowe systemy cache'owania prefiksów wymagały, aby wiele żądań dzieliło wspólny początkowy prefiks - co ograniczało ich efektywność. KVBoost rozwiązuje ten problem, umożliwiając reuse cache'u niezależnie od tego, gdzie w tekście pojawia się współdzielona treść.

System wykorzystuje podwójny schemat haszowania, który oddziela tożsamość pozycyjną (prefiks hash) od tożsamości zawartości (content hash), pozwalając na dokładne i przybliżone dopasowania cache'u. Kluczową innowacją są dwie strategie naprawy błędów brzegowych powstających z niezależnie cachowanych fragmentów: SelectiveRecompute ponownie koduje regiony brzegowe, a CacheBlendRecompute identyfikuje i przelicza tokeny o wysokim odchyleniu po przejściu sondującym. KVBoost dodatkowo integruje asymetryczną kwantyzację kluczy i wartości (int8/int4), adaptacyjne dzielenie granic fragmentów oraz ważone wydalanie cache'u pod stałym budżetem pamięci.

W testach na modelu Qwen2.5-3B z ponad tysiącem próbek lokalizacji błędów KVBoost osiągnął zmniejszenie czasu do pierwszego tokena z 639,1 ms do zaledwie 142,4 ms - ponad 4,5-krotne przyspieszenie. System przewyższył istniejące rozwiązania prefix cachingu o 16 procent bez żadnej utraty dokładności (99,2 procent vs 99,1 procent). Rozwiązanie jest kompatybilne z popularnymi modelami opartymi na mechanizmie RoPE i stanowi praktyczną warstwę przyspieszającą wnioskowanie, którą można łatwo integrować z modelami kompatybilnymi z HuggingFace.