ExFold to nowa metoda przyspieszająca inference modeli Mixture-of-Experts bez dodatkowego trenowania. Problem, który rozwiązuje, jest głęboko techniczny: modele MoE działają w dwóch bardzo różnych fazach. W fazie prefill (przetwarzanie nowych tokenów) wąskim gardłem jest liczba obliczeń na token, podczas gdy w fazie decode (generowanie odpowiedzi) problemem jest przepustowość pamięci między aktywowanymi ekspertami a batchem żądań.
Istniejące metody przyspieszania zazwyczaj optymalizują tylko jedną z tych faz, skupiając się albo na ekspertach aktywowanych dla każdego tokenu, albo na ekspertach użytych dla całego batchu. ExFold unifikuje te dwa problemy, traktując je jako jedno zagadnienie: wykonaj tylko niezbędnych ekspertów dla danej fazy, a wkład wyłączonych ekspertów opisz matematycznie przez projekcję na zachowane ekspertyzy.
Kluczowa obserwacja stojąca za metodą to fakt, że wiele wyjść różnych ekspertów wskazuje w tym samym kierunku, różnią się jedynie siłą (magnitudą) wektora. Dzięki temu ExFold może kalibrować macierz skalarnych projektorów na nieoznaczonych danych, a następnie stosować ją podczas inferecji. W praktyce prefill przyspieszany jest przez top-K folding na poziomie tokenów, a decode przez top-K folding na poziomie batchu. To podejście bez treningu potencjalnie znacznie zmniejsza latencję serwowania MoE bez dodatkowych kosztów obliczeniowych na etapie uczenia.