Badacze opracowali nową metodę kompresji dużych modeli językowych opartą na curriculum learning przeprowadzanym warstwami sieci neuronowej. Zamiast trenować cały model jednocześnie, metoda dzieli go na segmenty warstw i optymalizuje je progresywnie, zaczynając od łatwiejszych zadań. To podejście znacznie przyspiesza zbieżność i stabilizuje proces transferu wiedzy między modelami.
Kluczową innowacją jest połączenie curriculum learning z techniką cachowania cech i strategią wielowątkowości, które efektywnie radzą sobie z misalignmentem funkcji między warstwami i maksymalizują wykorzystanie GPU. Teoretyczna analiza zjawiska skumulowanego błędu wykazała, dlaczego ten podział warstwami działa lepiej niż tradycyjne podejścia monolityczne.
Eksperymentalne rezultaty są imponujące: na modelach BERT i GPT-2 metoda zmniejszyła zużycie pamięci GPU i czas treningu o więcej niż 50 procent. Testy na nowszych modelach z rodziny LLaMA i Qwen pokazały, że nowa metoda przebija dotychczasowe techniki przycinania przy tym samym budżecie czasowym, jednocześnie zajmując mniej miejsca w pamięci. Połączenie wydajności optymalizacyjnej z gotowością do pracy na rzeczywistych nowoczesnych architekturach czyni to istotnym postępem w kompresji LLM.