Naukowcy zaproponowali AdaMem, framework'a mający rozwiązać problem nieefektywnego przetwarzania długich tekstów w systemach retrieval-augmented generation. W tradycyjnym podejściu każdy wciągnięty fragment tekstu otrzymuje taką samą liczbę memory tokenów do kompresji, niezależnie od tego, jak bardzo jest istotny dla zadawanego pytania. To prowadzi do marnotrawienia zasobów na mniej ważne informacje.

AdaMem zmienia tę strategię poprzez relevance-guided soft compression, która najpierw ocenia znaczenie każdego fragmentu dla konkretnego zapytania, a następnie przydziela mu odpowiednią liczbę tokenów pamięci z ustalonego budżetu. Shared query-conditioned compressor generuje zarówno ciągłe embedding'i pasażu jak i score'y istotności w jednym przebiegu. Deterministic allocation rule przydzielając więcej tokenów fragmentom o wyższych ocenach może też całkowicie pominąć fragmenty mało istotne.

Wyniki testów na sześciu otwartych benchmarkach QA pokazują konsystentne poprawy w stosunku do OSCAR, dotychczasowego baseline'u soft-compression z równomierną alokacją. Przy standardowej kompresji 16x AdaMem ulepszył sub-string match aż o 3.2 punktu procentowego (5.5% względnie) ze średnim względnym wzrostem 3.4%. Pod bardziej agresywną kompresją 64x średni wzrost względny sięga 14.6%, a maksymalnie 19.7% na benchmarku PopQA. Podejście jest szczególnie efektywne w scenariuszach wymagających silnej kompresji informacji przy zachowaniu wysokiej jakości odpowiedzi.