Naukowcy z arXiv opublikowali LRCC - metodę, która dodaje do skompresowanych modeli językowych zdolność do adaptacyjnego dostosowania obliczeń w zależności od napływających tokenów. Dotychczasowe podejścia do kompresji niskiego rzędu przydzielały tę samą ilość mocy obliczeniowej każdemu tokenowi, bez względu na jego zawartość. LRCC zmienia to podejście, wprowadzając lekkie routery w każdym bloku Transformera, które wybierają między kilkoma zagnieżdżonymi ścieżkami niskiego rzędu.

Klucz do efektywności tej metody to sposób treningu - czynniki niskiego rzędu pozostają zamrożone, a optymalizowane są wyłącznie routery. To sprawia, że process adaptacji jest szybki i wymaga mniej zasobów. Testy na modelach Llama-2-7B, Llama-3.2-1B i Qwen wykazały imponujące rezultaty: przy tej samej średniej liczbie aktywnych parametrów LRCC poprawia wydajność względem statycznych metod kompresji o 7,6 punktu procentowego w średniej dokładności na zadaniach downstream. Co ważne, metoda osiąga to bez użycia specjalistycznych kerneli, pracując z domyślnymi optymalizacjami.

Z perspektywy praktycznej jest to znaczący postęp - pozwala na dalsze zmniejszanie kosztów operacyjnych już skompresowanych modeli, które są coraz powszechniej wdrażane w aplikacjach produkcyjnych. Analiza wyboru ścieżek przez routery pokazuje, że rzeczywiście istnieją Token-zależne preferencje, co sugeruje potencjał dla jeszcze bardziej zaawansowanego optymalizowania wydajności modeli.