Naukowcy opublikowali na arXiv nową metodę zwaną Progressive², która rozwiązuje fundamentalny problem knowledge distillation - kompresji dużych modeli sztucznej inteligencji do postaci działającej na zwykłych urządzeniach. Tradycyjna destylacja wiedzy transfer wiedzy z dużego modelu do małego, ale gdy różnica między nimi jest zbyt duża, uczący się model nie potrafi skutecznie przejąć informacji. Progressive² zmienia to podejście, wprowadzając ewolucję na obu stronach procesu.
Metoda opiera się na dwóch kluczowych innowacjach. Po stronie nauczyciela zamiast angażowania wszystkich warstw na raz, system progresywnie dodaje nowe warstwy do destylacji w oparciu o postępujące od prostych do złożonych reprezentacji semantyczne - tworząc uporządkowany plan nauki. Dodatkowo badacze zaprojektowali adapter fuzji wielu cech po stronie nauczyciela, który poprawia stabilność trenowania, wspierany teoretycznie zasadami ciągłości Lipschitza. Po stronie ucznia zamiast od razu trenować najmniejszy możliwy model, sieć neuronowa jest stopniowo zmniejszana, co umożliwia iteracyjną koewolucję z nauczycielem.
To rozwiązanie ma duże znaczenie dla praktycznego wdrażania zaawansowanych modeli AI na urządzeniach klienckich z ograniczonymi zasobami, co jest kluczowym wyzwaniem dla skalowania technologii sztucznej inteligencji. Progressive² oferuje elastyczną ramę, gdzie strategie po stronie nauczyciela mogą być wdrażane niezależnie, co otwiera możliwości hybrydowych podejść do kompresji modeli.