Zespół naukowców wprowadził ZGCM-1, siedmiomiliardowy gęsty model foundation trenowany od podstaw z ekstremalną efektywnością danych, systemową i algorytmiczną. Model zakłada, że kompaktowe modele nie mogą biernie zapamiętywać otwartej sieci, ale mogą przezwyciężyć ograniczenia pojemności parametrycznej poprzez połączenie celowego wewnętrznego myślenia z aktywnym wykorzystaniem narzędzi zewnętrznych.
ARCHITEKTURA i SYSTEM były projektowane wspólnie z przeplotem przesuwających się okien z pełną atencją oraz stabilnym optymalizatorem FP8 Muon. Trening progresywny obejmował skalowanie kontekstu przez 16K, 64K i 256K tokenów, a także reformułowanie śladów interakcji w procesy decyzyjne Markowa (MDP). Innowacyjnie, zespół wdrożył natywny dla AI przepływ pracy badawczo-rozwojowy, gdzie roje agentów autonomicznie zarządzają operacjami klastrów, kuratorią danych i szybką oceną diagnostyczną.
ZGCM-1-7B wykazuje konkurencyjne wyniki wobec rodziny modeli 7B na ogólnych benchmarkach, a w zadaniach rozumowania matematycznego i wyszukiwania agentowego pozostaje konkurencyjny z modelami granicznymi wiele razy większymi, takimi jak Qwen3-235B-A22B czy GLM-5.1. Zespół zgłasza około 4,2-krotne przyspieszenie efektywności w pre-treningu do 16K tokenów. Badanie zawiera osiem praktycznych ustaleń empirycznych dotyczących skalowania architektury, czyszczenia jakości SFT i długiego kontekstu, które mogą przewodniczyć dalszemu rozwojowi modeli efektywnych.