Together AI przeprowadziło bezpośrednie porównanie modeli GLM-5.3 i GPT-5.6 Sol na benchmarku DeepSWE, wykonując 904 rollouty w celu zmierzenia wydajności rozwiązywania zadań kodowania. GPT-5.6 Sol wykazał wyższość w metryce pass@1, gdzie jego wynik był wyższy o 3,7 punktu procentowego, wskazując lepszą wydajność przy pierwszej próbie rozwiązania.
Jednak GLM-5.3 zdobył przewagę w pass@4, czyli przy możliwości wygenerowania czterech rozwiązań i wybrania najlepszego - wszystko to przy połowie kosztu operacyjnego GPT-5.6 Sol. To pokazuje, że bardziej zaawansowany model nie zawsze jest ekonomicznie optymalnym wyborem dla każdego scenariusza. Interesujące jest też, że cascade routing - strategia najpierw kierująca żądania do GLM-5.3, a trudniejsze przypadki do GPT-5.6 Sol - osiągnął wynik 85,9%, sugerując iż inteligentne routowanie między modelami może oferować lepszy kompromis między jakością a kosztami niż poleganie na jednym, droższym rozwiązaniu.
Takie badania mają znaczenie dla organizacji optymalizujących wydatki na LLM-y w produkcji. Pokazują, że nie każdy prompt wymaga największego dostępnego modelu, a dobrze zaprojektowana strategia routingu może drastycznie obniżyć koszty infrastruktury AI bez znaczącej utraty jakości wyników.