Naukowcy przetestowali narzędzie galahad-kv, które rewolucjonizuje pracę z długimi kontekstami w modelach językowych poprzez zapisywanie kluczowego stanu obliczeniowego (KV) dla każdego bloku około 16 tysięcy tokenów na szyfrowany dysk NVMe, zamiast przeliiczania go za każdym razem. Test przeprowadzono na 50 milionach tokenów rzeczywistego tekstu publicznego, wykorzystując serwer vLLM na jednym procesorze NVIDIA H100 i dwa modele - Gemma 4 12B oraz Gemma 4 31B, z wspaniałymi wynikami: wszystkie 100 testowanych bloków zostały załadowane z magazynu bez błędów na obu modelach.
Wydajność jest imponująca. Załadowanie zapisanego bloku z dysku okazało się 2,8 do 4,3 razy szybsze niż jego ponowne obliczenie, zużywając jednocześnie 8,8 do 12,3 razy mniej energii GPU. Zużycie pamięci GPU pozostało stabilne przez całe przetwarzanie 50 milionów tokenów. Gdy pytano modele o fakty zaszyte miliony tokenów wcześniej, model 12B udzielił poprawnej odpowiedzi 82 razy na 100, a model 31B aż 98 razy na 100 - co najważniejsze, żaden model nie wymyślił sobie odpowiedzi.
Rozwiązanie ma jednak ograniczenia. To system przeładowywania zapisanego stanu, a nie rozszerzanie okna attention - bloki ładowane są jeden na raz, a jakość odpowiedzi zależy od możliwości modelu. Zapisanie pamięci to koszt jednorazowy, ale wymaga terabajtów lokalnego magazynu NVMe. Mimo to podejście otwiera nowe możliwości dla aplikacji wymagających rzeczywistej długoterminowej pamięci, stanowiąc praktyczną alternatywę dla droższych metod przeliczeń.