Together AI przeprowadził dokładne porównanie dwóch wariantów modelu GLM-5.3 na zbiorze testowym DeepSWE z wykorzystaniem 900 rolloutów. Wyniki pokazują, że GLM-5.3 Flash osiąga 17-krotnie niższy koszt operacyjny przy obniżeniu wydajności o 5,6 punktu w metrycie pass@1, czyli gdy model musi rozwiązać zadanie za pierwszym razem.

Różnica staje się jednak mniej znacząca w bardziej elastycznych scenariuszach. W metryce pass@4, gdzie model dostaje cztery próby na rozwiązanie problemu, stratę wydajności Flash zmniejsza się do zaledwie 2,6 punktu. To sugeruje, że szybsza wersja generuje wciąż prawidłowe rozwiązania, ale może potrzebować większej liczby prób lub iteracji.

Badanie ma znaczenie dla zespołów i produktów wybierających architekturę AI dla zadań związanych z kodowaniem. Dla aplikacji wymagających każdorazowo poprawnego wyniku Flash może być zbyt drogi kompromis, ale dla systemów pozwalających na wiele iteracji lub rzeczywiste scenariusze inżynierskie, gdzie koszty operacyjne drastycznie wzrastają, taka redukcja wydatków przy względnie niewielkiej stracie na wydajności staje się atrakcyjna. Rezultaty wskazują też na rosnącą efektywność destylacji modeli - Flash nie to tak zwyczajnie obcięty model, ale inteligentnie optymalizowany wariant.