EntropyMoE wprowadza nową architekturę Mixture-of-Experts (MoE) specjalnie zaprojektowaną dla modeli językowych opartych na dynamicznych fragmentach bajtów, rezygnujących z tradycyjnego tokenizera. Problem, który rozwiązuje, dotyczy ineffektywności istniejących architektur byte-level, które aplikują identyczne, gęste obliczenia do każdego fragmentu niezależnie od jego semantyki lub granularności.
Rdzeniem innowacji jest wykorzystanie entropii poszczególnych fragmentów jako sygnału routowania do ekspertów. Każdy dynamiczny fragment bajtów stanowi jednostkę routowania, a jego pokrycie bajtowe determinuje jego udział w załadowaniu obliczeniowym systemu. Architektura zastępuje tradycyjne gęste warstwy feed-forward w globalnych Transformerach na poziomie fragmentów warstwami Top-K ekspertów. Entropja fragmentu i jego długość wspólnie definiują przestrzeń cech dla specjalizacji ekspertów, pozwalając modelowi adaptacyjnie alokować zasoby obliczeniowe.
Eksperymentalne rezultaty pokazują, że EntropyMoE uzyskuje najniższe wartości bits-per-byte na zbiorze testowym spośród porównywanych gęstych i rzadkich modeli bazowych, jednocześnie utrzymując porównywalną dokładność na zadaniach downstream. Praca ustanawia entropję fragmentów jako efektywny sygnał routowania do obliczeń rzadkich i warunkowych, rozszerzając modelowanie Mixture-of-Experts poza tradycyjne reprezentacje oparte na tokenach. Przełom ten ma znaczenie dla przyszłych architektur LLM pracujących bezpośrednio na surowych bajtach, gdzie efektywne wykorzystanie mocy obliczeniowej jest kluczowe.