Zespół badaczy zaproponował IterCOMP - pierwszą metodę kompresji promptów uwzględniającą wieloetapowe rozumowanie logiczne dla systemów retrieval-augmented generation. Problem, który rozwiązuje, jest konkretny: gdy modele szukają odpowiedzi na skomplikowane pytania wymagające połączenia informacji z wielu źródeł, otrzymują długie i szumne konteksty, które obniżają zarówno wydajność, jak i dokładność. Dotychczasowe metody kompresji nie radziły sobie z takimi scenariuszami, bo zostały zaprojektowane dla pojedynczych zapytań i nie uwzględniają współzależności między krokami rozumowania.
IterCOMP działa w oparciu o iteracyjną pętlę: dzieli dokumenty na segmenty zawierające potencjalne dowody, ocenia czy pytanie można w ogóle odpowiedzieć na podstawie dostępnych danych, a następnie generuje celowane pytania pomocnicze. Te pytania prowadzą system do kolejnych niezbędnych fragmentów tekstu. W rezultacie uzyskuje się zwarty, skoncentrowany na logice prompt zamiast pełnego dokumentu. Metoda nie wymaga trenowania - pracuje z już istniejącymi modelami bez jakichkolwiek zmian wag.
Wyniki eksperymentów są znaczące. Na trzech popularnch benchmarkach - MusiQue, 2WikiMultiHopQA i HotpotQA - IterCOMP osiągnął wyraźne ulepszenia w metrykach Exact Match i F1-score jednocześnie zmniejszając budżet tokenów. Co ważne, metoda pokazała odporność: im bardziej skomplikowane było rozumowanie wymagane pytaniem, tym lepiej wypadła w porównaniu z innymi podejściami. To sugeruje, że iteracyjna kompresja uwzględniająca logikę może stać się standardowym sposobem pracy z złożonymi pytaniami w systemach RAG.