Alibaba wydała Qwen3.8-Flash-Next - model Mixture-of-Experts z 125 miliardami parametrów, w którym podczas każdego kroku aktywuje się zaledwie 6 miliardów parametrów. Oprócz głównego modelu, system zawiera 51-miliardową tabelę N-gram embedding oraz 4-miliardowy moduł do przewidywania wielotokenowego, osiągając łączną wielkość 180 miliardów parametrów. Zespół Qwen posadził to jako wczesny podgląd architektury, która będzie napędzać Qwen4, pełniąc tę samą rolę, którą Qwen3-Next pełnił dla Qwen3.5.

Klucze do redukcji kosztów to cztery główne innowacje. Pierwsza to hybrydowe podejście do attention - trzy na cztery warstwy używają Gated DeltaNet, liniowej warstwy attention, która kompresuje historię do stanu rekurencyjnego o stałym rozmiarze, podczas gdy czwarta warstwa uruchamia Qwen Sparse Attention. Druga zmiana to Gated Residual, trzecia to N-gram Embedding, a czwarta to optymalizator Muon. Zespół Qwen zgłasza, że koszty treningu Qwen3.8-Flash-Next to około jedna-dziewiąta kosztu Qwen3.7-Plus. Rzadka aktywacja zmniejsza wymaganą moc obliczeniową, ale nie rozmiaru modelu w pamięci.

Model jest wdrażalny, ale wymaga specjalistycznego sprzętu. Checkpoint w precyzji FP8 zajmuje 172,78 GiB, a BF16 - 335,28 GiB. Na H200 wymagana jest co najmniej konfiguracja Tensor Parallel 2 dla FP8, przy czym TP4 jest zalecane. Na węźle 8xH200 trzeba używać TEP8, podczas gdy zwykłe TP8 jest niezgodne z kwantyzacyjnymi blokami o szerokości 128. To nie jest model dla stacji roboczych, ale dla serwerów przy infrastrukturze AI drugiego poziomu.