Z.ai i Alibaba Qwen wydały w ciągu zaledwie jednego dnia dwa fundamentalnie różne modele, które zaskakująco korzystają z prawie identycznej architektury, mimo że zespoły projektowały je niezależnie. GLM-5.3-Flash to pierwszy natywnie multimodalny model serii GLM-5, liczący 320 miliardów parametrów z 18 miliardami parametrów aktywnych, dostępny na licencji MIT. Qwen3.8-Flash-Next zawiera 125 miliardów parametrów z 6 miliardami aktywnymi i stanowi podgląd przychodzące architektury Qwen4.

Obydwa modele wykorzystują zaskakująco podobne konfiguracje pomimo niezależnego rozwoju. Obie systemy łączą attention liniowy i pełny w proporcji 3:1, stosują kompresowany indekser do wyboru kontekstu ograniczony do 2048 tokenów, rozszerzają residual stream na cztery gałęzie ze wrotami, oraz trenują się przy użyciu optimizera Muon z fuzjowanymi macierzami parametrów dzielonymi przed ortogonalizacją. GLM-5.3-Flash wytrenowano na 30 bilionach tokenów multimodalnych i obsługuje okno kontekstu 1 miliona tokenów, osiągając większą popularność na OpenRouter niż inne modele danego tygodnia, przy cenach 0,15 dolara za milion tokenów wejścia i 0,50 dolara za milion tokenów wyjścia.

Zbieżność tych rozwiązań sygnalizuje, że niezależne zespoły badawcze zmierzają organicznie ku tym samym architekturowym rozwiązaniom. Nie jest to pierwsze takie zjawisko w AI - historycznie podobne paradygmaty pojawiały się jednocześnie w różnych laboratoriach - ale w tym przypadku szczegółowość zbieżności (zarówno makro jak i mikro-decyzje projektowe) sugeruje, że istnieje ścieżka naturalnej ewolucji architektur modeli. To ma znaczenie dla całej dziedziny, gdyż wskazuje, w którą stronę zmierza industria oraz że zaobserwowane rozwiązania mogą być nie przypadkowe, ale wynikiem zbieżności badawczej na fundamentalnym poziomie.