Together AI przeprowadził szczegółowe porównanie dwóch dużych modeli na benchmarku DeepSWE, testując 904 rozwinięcia dla każdego z nich. GPT-5.6 Sol od OpenAI osiąga wyższą dokładność w metrice pass@1 - prowadzi o 10 punktów - ale wymaga 35 razy wyższych kosztów obliczeniowych w stosunku do DeepSeek V4 Pro 0813.

Na tym tle DeepSeek V4 Pro wyraźnie wygrywa w metrice pass@4, czyli gdy model ma cztery próby na rozwiązanie problemu kodowania. To sugeruje, że chociaż DeepSeek jest słabszy w pierwszej próbie, jego dywersyfikacja rozwiązań jest lepsza. Co ważne, strategia routingu - czyli wysłanie zapytania najpierw do DeepSeek V4 Pro, a w razie potrzeby do GPT-5.6 Sol - osiąga 83 procent dokładności na DeepSWE.

Wynik ma znaczenie dla firm optymalizujących koszty operacyjne modeli AI. Zamiast placów wszystko na GPT-5.6 Sol, routing inteligentnie łączący tańszy, solidny model DeepSeek z droższym GPT-5.6 może dać lepszy bilans wydajności i ceny. To pokazuje, że największa wszechstronność niekoniecznie daje najlepszy zwrot z inwestycji.