Z.ai właśnie zaprezentował GLM-5.3-Flash, pierwszy w pełni multimodalny model z rodziny GLM-5, który łączy moc dużego modelu z dostępnością ceną. To model o architekturze mixture-of-experts z 320 miliardami parametrów całkowitych, przy czym tylko 18 miliardów aktywnych na token, co zmniejsza koszty obliczeniowe. Okno kontekstu wynosi ponad 1 milion tokenów, co pozwala na przetwarzanie długich dokumentów. Model wspiera native'owe przetwarzanie obrazów i wideo, co wyróżnia go spośród wcześniejszych wersji GLM-5.

Wydajność GLM-5.3-Flash jest imponująca biorąc pod uwagę cenę. Według wewnętrznych benchmarków laboratorium, model przewyższa swój poprzednik GLM-5.2 na większości testów przy około dziesięciokrotnie niższych kosztach. W benchmark'u kodowania, który opracowało Z.ai, wynik jest zaledwie o pół punktu niższy od Claude Opus 4.8. Model przez pierwszy tydzień działał anonimowo jako "Ox Alpha" na platformach OpenCode i OpenRouter, całkowicie na chińskich procesorach AI.

Dostęp do modelu jest dostępny na dwóch ścieżkach. Wagi są już dostępne na Hugging Face na licencji MIT, a równocześnie działa hostowana wersja API z ustaloną ceną. Self-hosting wymaga jednak solidnego sprzętu - checkpoint w formacie FP8 zajmuje około 306 GiB bez cache'u KV, a obecna implementacja vLLM obsługuje tylko procesory NVIDIA Hopper i nowsze. To oznacza, że self-hosting jest realistyczny dla średnich i dużych organizacji posiadających co najmniej 8 GPU, lub startupów technologicznych wynajmujących moc obliczeniową w chmurze. Mniejsze podmioty będą korzystać z API, gdzie właściwie to ekonomika, a nie hardware, jest kluczowym czynnikiem. Model ma potencjał zwłaszcza dla branż takich jak software i devtools, automatyzacja IT i business process outsourcing, finanse, ubezpieczenia, business intelligence oraz operacje back-office.