Alibaba Qwen wydała Qwen3.8-Omni-Flash - model zdolny do przetwarzania tekstu, obrazów, audio i wideo w jednym systemie. Model oparty na architekturze Qwen3.8-Flash-Next udostępnionym z otwartymi wagami w sierpniu 2026 oferuje kontekst 1M tokenów, z maksymalnym inputem 991K i outputem 131K tokenów. Co wyróżnia ten model to jego agentic capabilities - przepływ pracy opiera się na zrozumieniu treści, zaplanowaniu zadania, wykonaniu za pomocą dostępnych narzędzi i dostarczeniu wyniku.

Model jest natychmiast dostępny jako hosted API na QwenCloud, Alibaba Cloud Model Studio i Qwen Studio. Obsługuje zarówno protokół DashScope jak i OpenAI, pracuje z Chat Completions i Responses API. Wspiera function calling, wyszukiwanie w sieci, structured outputs, context caching i batch calls. Thinking jest domyślnie włączony z reasoning_effort ustawionym na xhigh, co można wyłączyć. Output jest zawsze tekstowy, a do generowania mowy dokumentacja odsyła do modelu Qwen3.5-Omni.

Znaczące innowacyjne podejście dotyczy przetwarzania długich filmów. Zamiast liniowego czytania całego pliku od początku do końca, agent wykorzystuje agentic perception - może inteligentnie skoncentrować się na istotnych fragmentach. To rozwiązuje problem przetwarzania zasobów przy pracy z długimi materiałami wideo. Brak otwartych wag oznacza, że model pozostaje ekskluzywnością Alibaby, ograniczając self-hosting, ale zapewnia pełną kontrolę nad infrastrukturą i monetyzacją.