Naukowcy z arXiv zaproponowali nowe podejście do kompresji kontekstu w systemach RAG działających na brzegowych urządzeniach obliczeniowych. Tradycyjne metody retrieval-augmented generation pobierają zewnętrzne fragmenty tekstu, które następnie wydłużają prompt i zwiększają obciążenie obliczeniowe - zarówno podczas prefill (przygotowania KV-cache), jak i podczas samej generacji. Proponowana kompresja adaptywna mają działać w czasie rzeczywistym, dostosowując stopień kompresji do bieżących warunków urządzenia, zamiast używania stałych parametrów ustalonych offline.

Badania przeprowadzone na NVIDIA Jetson AGX Thor z wykorzystaniem modeli Llama i Qwen, zbiorów Natural Questions i HotpotQA oraz kompresora LLMLingua-2 ujawniły kluczowy problem: sama kompresja konsumuje znaczące zasoby procesorowe i energetyczne. Pomiary pokazały, że faza generacji dominuje budżet obliczeń, stanowiąc około 90 procent całkowitego czasu na zapytanie i 91 procent energii GPU dla generatorów 7B-8B. To oznacza, że kompresja musi być bardzo efektywna, aby opłacać się energetycznie.

Znaczenie badania polega na tym, że adaptive compression otwiera możliwość zoptymalizowania wydajności RAG na urządzeniach brzegowych poprzez monitoring telemetrii. Zbyt łagodna kompresja może zmarnować okazję do zaoszczędzenia energii, podczas gdy nadmiernie agresywna kompresja degraduje jakość wyników. Przemyślane, dynamiczne podejście do tego problemu może znacznie poprawić praktyczną użyteczność systemów RAG na mobilnych i embedded devices.