Naukowcy opracowali Mixture of Channel Experts (MoCE), nową strukturę do efektywnego mieszania kanałów w sieciach neuronowych, która drastycznie zmniejsza koszty obliczeniowe projekcji kanałów bez straty dokładności. Zamiast przetwarzać wszystkie kanały wejściowe, każdy ekspert pracuje na rzadkim zbiorze k wybranych kanałów z całkowitej liczby C kanałów. Połączenie wybranych kanałów odbywa się przez softmax z temperaturą przewidywaną dla każdego wejścia, co pozwala ekspertom przełączać się między agregacją typu średnia a typu maksimum.
Koncepcja wzoruje się na popularnym podejściu Mixture-of-Experts z modelami językowymi, lecz w zupełnie inny sposób. Pierwotne próby przeniesienia MoE do sieci konwolucyjnych zawodzą - równoległe eksperty konwolucyjne czytające te same kanały wejściowe uczą się niemal identycznych filtrów, co czyni je nieskuteczne. MoCE rozwiązuje ten problem poprzez przesunięcie osi eksperta z duplikacji operatorów do selekcji kanałów. Warstwa zawiera również eksperta rezyduowego, który podsumowuje niewybranych kanały, oraz funkcję balansu obciążenia, aby zapewnić pełne pokrycie kanałów.
Wydajność jest imponująca: MoCE zastępuje gęstą projekcję o koszcie kwadratowym względem liczby kanałów mechanizmem, którego względny koszt skaluje się jako k/C. W praktycznych pomiarach oszczędności teoretyczne przełożyły się na rzeczywisty czas wykonania. Testy na architekturach ResNet z ImageNet-1K i CIFAR-100, transfer learning oraz nowoczesne przepisy treningowe pokazują, że MoCE równoczy lub przewyższa gęste modele bazowe i wcześniejsze metody selekcji kanałów, jednocześnie redukując operacje mnożenia-dodawania (MACs) o 16,7 procent i skracając end-to-end latency.