Naukowcy z arXiv opublikowali badania nad bezstratną kompresją promptów w dużych modelach językowych, osiągając średnie zmniejszenie liczby tokenów o 40,3% za pomocą pipeline'u opartego wyłącznie na klasycznych technikach NLP bez konieczności dodatkowego uczenia. Metoda składa się z jedenastu konfigurowalnych transformacji lexikalnych, takich jak usuwanie stopwords, skrótowanie wyrażeń wypełniających, zastępowanie skrótów, pruning oparte na part-of-speech, lemmatyzacja czy shortening synonimów przy pomocy WordNet.
Motywacja za pracą jest pragmatyczna: współczesne prompty dla LLM-ów sięgają tysiące tokenów dzięki technikom takim jak chain-of-thought czy in-context learning, znacznie zwiększając koszty i opóźnienia inferencji. Istniejące metody kompresji oparte na uczeniu (np. LLMLingua czy Selective Context) osiągają wysokie kompresje, ale wymagają dodatkowych modeli pomocniczych i są niedeterministyczne. Badacze postanowili zbadać, jak daleko można zajść z podejściem całkowicie deterministycznym działającym na CPU.
Ewaluacja obejmowała 1242 angielskie prompty ze sześciu źródeł (Dolly-15k, LMSYS-Chat-1M, WildChat-1M, MMLU, GSM8K, HellaSwag), obejmujące jedenaście automatycznie wyodrębnionych kategorii zadań. Wygenerowano 18630 par odpowiedzi z GPT-4o-mini, mierząc zachowanie wyjścia przy pomocy BLEU, ROUGE, BERTScore i SentenceBERT. Najbardziej agresywna konfiguracja osiągnęła redukcję średnio o 40,3% tokenów (sigma 9,2), stanowiąc praktyczną alternatywę dla metod wymagających dodatkowych zasobów obliczeniowych.