Modele Mixture-of-Experts generują podczas wnioskowania dane routingu, które zwykle loguje się dla monitoringu, debugowania i audytu bezpieczeństwa - te telemetryczne informacje mogą jednak ujawnić, czy konkretne dane były użyte do fine-tuningu wdrożonego modelu. Zespół badawczy zidentyfikował podatność polegającą na łączeniu tradycyjnych sygnałów z wyjścia modelu z zagregowanymi cechami routingu w celu zidentyfikowania danych treningowych.

Atak membership inference oparty na routerach osiągnął szokujące rezultaty: zwiększył wskaźnik true positive rate przy 1 procent false positive rate o 2,7-9,4 procent w stosunku do samych sygnałów wyjściowych. Badania przeprowadzono na trzech architekturach MoE i trzech domenach danych - podatność pozostała konsekwentna. Co ważne, leakage informacji persystuje niezależnie od zastosowanej metody trenowania - równie dobrze obserwuje się go przy full fine-tuningu, zamrożonym routerze, LoRA czy instruction tuningu.

Mechanistyczna analiza ujawnia, że problem nie wymaga specjalnego memoryzowania przez router. Fine-tuning wprawdzie wprowadza informacje o członkowstwie do ukrytych reprezentacji, ale router eksponuje projekcję tego sygnału nawet wtedy, gdy jego parametry są zamrożone. Perturbacje telemetrii zmniejszają dodatkowy leakage tylko proporcjonalnie do utraty wierności danych - oznacza to, że obfuskacja musi być drastyczna, aby być skuteczna.