Kiedy kontekst w dużych modelach językowych przekracza dostępną przestrzeń, systemy automatycznie go kompresują, aby móc kontynuować pracę. Problem polega na tym, że podczas tego procesu tracone są kluczowe instrukcje użytkownika - tak zwane Session Constraints - czyli polecenia takie jak "nie usuwaj żadnych emaili dopóki nie dam potwierdzenia", które mają obowiązywać do końca sesji.
Badacze z uniwersytetów oraz lab AI stworzyli COMPINT - zestaw testów ewaluacyjnych sprawdzający, jak dobrze kompresory radzą sobie z zachowaniem tych ograniczeń w trzech typowych scenariuszach: wieloturowych rozmowach, trajektoriach agentów AI i długoterminowych badaniach. Wyniki są alarmujące - obecne kompresory zatrzymują średnio tylko 17 procent z injektowanych ograniczeń. Większość z nich radzi sobie gorzej niż zadania wykonywane bez kompresji. Dodatkowo strata ograniczeń zmienia się drastycznie w zależności od używanego kompresora, sformułowania instrukcji, długości kontekstu czy miejsca, w którym ograniczenie zostało umieszczone.
Problematyczne jest, że ta niestabilność ma charakter systemowy - nie wynika z jednego konkretnego ustawienia. Jako rozwiązanie naukowcy zaproponowali moduł ekstraktor SC-aware, który pracuje równolegle do kompresorów bez potrzeby modyfikowania samego modelu. Nowy podejście osiąga ponad 90 procent retencji ograniczeń we wszystkich trzech scenariuszach testowych. Kod i narzędzia są dostępne publicznie na GitHub, co pozwala społeczności szybko integrować to rozwiązanie z istniejącymi systemami.