Together AI przeprowadziła gruntowne porównanie modelów GLM-5.3 i Claude Fable 5 na benchmarku DeepSWE, uruchamiając 904 rolloutów dla każdego z nich. Choć oba modele wykazały identyczne wyniki w metryce pass@1, GLM-5.3 wyraźnie wygrał w pass@4, jednocześnie kosztując 5,4 razy mniej - zaledwie 3,99 dolarów za rollout wobec 21,63 dla Claude Fable 5.
Benchmark DeepSWE to popularna metrika testująca zdolności modeli do rozwiązywania rzeczywistych zadań programistycznych. Różnica między pass@1 (czy model rozwiąże problem za pierwszym razem) a pass@4 (czy rozwiąże go w czterech próbach) jest kluczowa dla zrozumienia praktycznej użyteczności. Że GLM-5.3 wygrał w pass@4, sugeruje lepszą umiejętność iteracyjnego doskonalenia rozwiązań nawet jeśli pierwsza próba nie zawsze się powiedzie.
Te wyniki mogą mieć znaczący wpływ na decyzje firm wdrażających rozwiązania do automatyzacji kodu. Gdy cost-effectiveness jest równie istotny co wydajność, GLM-5.3 oferuje przekonujące uzasadnienie biznesowe. Dla deweloperów i zespołów DevOps szukających modelu do Code Review, bug fixingu czy generowania testów, porównanie ta sugeruje, że nie trzeba płacić premii za droższe rozwiązanie, aby uzyskać wyższą jakość.