Nowa metoda Thought-Aware Attention Matching (TAM) rozwiązuje problem rosnącego zużycia pamięci przez modele AI generujące długie ciągi rozumowania. Gdy modele wykonują chain-of-thought reasoning, ich cache key-value staje się ogromny i szybko wyczerpuje dostępną pamięć - dotychczasowe sposoby kompresji traktowały te sekwencje jako płaskie listy tokenów bez rozróżniania, które części są naprawdę ważne.

TAM wykorzystuje strukturę hierarchiczną procesu rozumowania poprzez trzy mechanizmy. Najpierw dzieli sekwencję na logiczne bloki myślenia, następnie przydziela budżet kompresji proporcjonalnie do ważności i rozmiaru każdego bloku, a wreszcie chroni kluczowe tokeny, które skupiają największą uwagę modelu. Zespół udowodnił matematycznie, że ich zasada alokacji budżetu jest optymalna w ramach wypukłego modelu błędu.

Wyniki eksperymentów na matematycznych zadaniach AIME 2024 i MATH-500 z czteromiliardowym modelem Qwen3-4B są imponujące - TAM osiąga lepszą dokładność niż uniform compaction przy tej samej pamięci, a przy okresowej kompresji ogranicza szczytowe zużycie pamięci do 3,1-3,2 GB, co stanowi 65-procentową redukcję. To otwarcie drogi do wdrażania zaawansowanych modeli reasoning na przeciętnych urządzeniach i zmniejszenia kosztów operacyjnych serwerów AI.