Naukowcy wprowadzili CausalGate, nową metodę do bardziej efektywnego działania wielkich modeli językowych, która mierzy rzeczywistą semantyczną szkodę zamiast polegać na heurystykach opartych na podobieństwie stanów ukrytych czy wielkościach aktywacji. Podczas fazy kalibracji system izoluje poszczególne warstwy Attention i MLP, zeruje ich wyniki i mierzy dokładny wpływ na ostateczny rozkład logitów poprzez dywergencję Kullbacka-Leiblera.

Klucz do praktyczności CausalGate leży w destylacji tej strukturalnej hierarchii ważności w zbiór statycznych, lekkich bramek skalarnych za pomocą celu smoothingowania Exponential Moving Average i różniczkowalnej straty pairwise ranking. Podejście to eliminuje overhead routingu w czasie wykonania, który obciąża tradycyjne metody dynamicznego routingu. Testy na trzech modelach - TinyLlama-1.1B, Qwen2.5-3B i Llama-3.1-8B - przeprowadzone na benchmarkach modelowania języka i rozumowania zdroworozsądkowego pokazały konsystentną przewagę nad dotychczasowymi podejściami.

Wyniki demonstrują, że przyczynowe podejście do oceny ważności modułów rzeczywiście przekłada się na mierzalne przyspieszenie na sprzęcie, без żadnych dodatkowych kosztów obliczeniowych. To istotne odkrycie dla praktycznego wdrażania oszczędnych modeli AI, szczególnie na urządzeniach o ograniczonych zasobach.