Naukowcy opracowali metodę Attention-Aware Routing, która usprawnia sposób, w jaki modele Mixture-of-Experts kierują tokeny do specjalistycznych eksperckich podsieci. Dotychczasowe routery opierały się głównie na ukrytym stanie tokena, ignorując szerszy kontekst. AAR rozszerza ten proces o cechy czasowe i spektralne pochodzące z okna wcześniejszych wag uwagi, dając routerowi dostęp do syntetycznego podsumowania stanu kontekstualnego modelu. Klucz: trening dotyczy wyłącznie parametrów routingu, pozostawiając transformera w całości zamrożony.

Wyniki pokazują wzrost wydajności - na zbiorze GSM8K (testy matematyczne) metoda zyskuje 3,37 punktu procentowego. Jeszcze bardziej interesujące są odkryte interakcje: routing i uwaga pracują jako sprzęgnięty obwód. Gdy zmienia się routing w warstwie l, zmiana propaguje się przez strumień residualny i wzmacnia tzw. attention sinks w warstwie l+1, bez bezpośredniego zmniejszenia mechanizmu uwagi. Efekt widoczny jest też w długości odpowiedzi - błędne odpowiedzi stają się krótsze, poprawne zachowują długość.

AAR wykazuje dużą czułość na głębokość sieci. Zastosowanie uniwersalnie może pogorszyć retrieval (wyszukiwanie faktów), ale głębokie umieszczenie poprawia matematyczne rozumowanie. Ta warstwa-specyficzna czułość odsłania napięcie między wyszukiwaniem faktów a logicznym wnioskowaniem w głębi sieci i czyniAAR precyzyjnym narzędziem do badania informacji istotnych dla routingu na różnych poziomach modelu.