Alibaba udostępniła Qwen3.8-Flash-Next, nowy otwarty model o wagach opartej na architekturze mixture-of-experts (MoE), który zawiera 125 miliardów parametrów, ale tylko 6 miliardów z nich jest aktywnych podczas każdej operacji. Ta struktura sparse przyznosi znaczący wzrost wydajności w porównaniu do tradycyjnych gęstych modeli o tym samym rozmiarze.

Model jest szczególnie interesujący dla badaczy i entuzjastów, bo stanowi wczesny podgląd architektury, którą Qwen planuje wykorzystać w przyszłej Qwen4. Można go uruchamiać na dostępnym sprzęcie jak NVIDIA DGX Spark za pomocą skwantyzowanych wersji, takich jak 72.5GB UD-IQ1_S czy 78.9GB UD-Q2_K_XL, co znacznie obniża barierę wejścia dla eksperymentów z tak zaawansowaną architekturą.

Wydanie modelu z otwartymi wagami oznacza, że społeczność może bezpośrednio testować i dostrajać architekturę MoE bez czekania na pełne wydanie Qwen4. To ważne dla rozwoju open source AI, zwłaszcza że pozwala badaczom zgłębiać potencjał modeli mixture-of-experts na etapie przed głównym wydaniem produkcyjnym.