Badacze z arXiv przedstawili MCF-MOE, framework mający rozwiązać problem niespójnego wyboru ekspertów w architekturach Mixture-of-Experts. W modelach MoE tokeny są kierowane do małego podzbioru ekspertów zamiast do całej sieci, co pozwala na efektywne skalowanie transformerów. Problem w dotychczasowych podejściach polega na tym, że routery podejmują decyzje opierając się na izolowanych reprezentacjach tokenów z pojedynczej warstwy, co powoduje niestabilne i semantycznie niespójne wybory między warstwami.

Proponowana metoda MCF-MOE adresuje ten problem poprzez konstruowanie reprezentacji uwzględniających kontekst poprzez integrację sygnałów z cross-layer semantic aggregation - innymi słowy łączenie informacji ze wszystkich warstw sieci - oraz lokalnych interakcji na poziomie tokenów. To pozwala routerom podejmować decyzje na podstawie pełniejszego obrazu kontekstu sekwencji. Taka zmiana ma fundamentalne znaczenie, ponieważ spójny routing przyczynia się do lepszej specjalizacji ekspertów i ogólnie wyższej wydajności sieci.

Eksperymenty na benchmarkach modelowania języka oraz zadaniach rozumienia pokazują konsystentną poprawę zarówno spójności routingu, jak i wydajności końcowej w porównaniu do bazowych implementacji MoE. Kod badania jest dostępny publicznie na platformie 4open.science, co pozwala społeczności badaczy na weryfikację i eksperymentowanie z metodą.