Badacze z arXiv przeprowadzili pierwszą systematyczną analizę wrażliwości poszczególnych warstw w modelach Mixture-of-Experts (MoE), korzystając z modelu Qwen3.6-35B-A3B. Model zawiera 40 warstw MoE, każda z 256 ekspertami, przy czym routing aktywuje top-8 ekspertów. Analizę przeprowadzono za pomocą magnitude-based expert maskingu na benchmarku XLCoST do tłumaczenia kodu między językami, testując skale od 100 do 500 promptów na infrastrukturze trzech serwerów z GPU H100.

Głównym odkryciem jest silna zależność wrażliwości od głębokości sieci. Warstwy początkowe (0-9) i środkowe (10-29) okazały się bardzo wrażliwe na maskowanie ekspertów, co oznacza że nie można ich optymalizować bez utraty jakości. W przeciwieństwie do tego, warstwy późne (30-39), a szczególnie bardzo późne warstwy (35-39), tolerują agresywne maskowanie ekspertów o niskim znaczeniu. Pojedyncze maskowanie na poziomie 30% wszystkich warstw zachowało tylko 150 z 300 prawidłowych odpowiedzi na skali 300 promptów, natomiast strategie skupiające się na warstwach końcowych osiągnęły 249-255 prawidłowych odpowiedzi przy maskowaniu 640-1145 ekspertów.

Najlepszy wynik uzyskano stosując wąską politykę na bardzo późnych warstwach (warstwy 35-39 z 50% maskowaniem), która na walidacyjnym zestawie 500 promptów zachowała 419 prawidłowych odpowiedzi przy maskowaniu zaledwie 640 ekspertów z 10240 całkowitych. Badanie dodatkowo oceniło zmniejszenie top-k routingu z 8 do 6 aktywnych ekspertów. Rezultaty sugerują możliwość znaczącej kompresji dużych modeli MoE poprzez inteligentne usuwanie redundancji z warstw końcowych.