Alibaba Qwen wydał Qwen-Image-2.1, ujednolicony model do generowania i edycji obrazów o rozmiarze 7 miliardów parametrów. Model zastępuje poprzednią architekturę z sierpnia 2025 roku, która wymagała osobnych checkpointów dla generacji tekstu na obraz i edycji - teraz obie funkcje działają w ramach jednego modelu, zmniejszonego z oryginalnych 20B parametrów.
Model stanowi znaczące ulepszenie pod względem praktyczności. Jego transformator wizyjny wykorzystuje 32 warstwy DiT (Diffusion Transformer) z pojedynczym streamem danych i blok-kauzalnym mechanizmem uwagi, co przyspieszył przetwarzanie. Do kodowania tekstu i warunkowych obrazów używa enkodera Qwen3-VL o rozmiarze 8B, a autoenkodera VAE ze wsparciem dla przejrzystości RGBA i kompresją 16x. Qwen-Image-2.1 obsługuje tekst-na-obraz, edycję wieloodniesieniową, lokalne poprawki i wyjście z kanałem alfa. Model dostępny jest dla badań bez dodatkowych ograniczeń, z natychmiasto wsparcie dla Diffusers, ComfyUI, vLLM-Omni, SGLang i LightX2V.
Znaczenie tego wydania polega na znalezieniu równowagi między funkcjonalnością a praktycznym wdrażaniem. Zmniejszenie rozmiaru modelu o 65 procent w stosunku do poprzednika przy zachowaniu dwóch głównych funkcji czyni go bardziej dostępnym dla mniejszych zasobów obliczeniowych, co otwiera drzwi dla szerszej adopcji w projektach badawczych i edukacyjnych. Jedynym ograniczeniem jest wymóg osobnej licencji dla komercyjnego wykorzystania.