Together AI przeprowadził bezpośrednie porównanie modeli Kimi K3 i GPT-5.6 Sol na benchmarku DeepSWE, uruchamiając 904 rolloutów dla każdego z nich. Wyniki ujawnily interesujący podział: GPT-5.6 Sol dominuje w metryce pass@1, czyli rozwiązywaniu zadań kodowania za pierwszą próbą, ale Kimi K3 radzi sobie znacznie lepiej w pass@4 - przy czterech próbach osiąga aż 2.8 raza więcej rozwiązań na jednostkę wydatków.

To odkrycie ma praktyczne znaczenie dla deweloperów wybierających modele do automatyzacji kodowania. Zamiast zawsze sięgać po najlepszy model w pojedynczej metryce, warto uwzględnić koszt. Routing - inteligentny system wyboru między modelami w zależności od zadania - osiągnął około 85.6 procent skuteczności, co sugeruje że hybrydowe podejście może dostarczać zarówno wysokiej jakości, jak i ekonomiczności.

Taki typ analizy staje się coraz ważniejszy w miarę jak LLM-y wdrażane są na skalę w produkcji. Nie zawsze droższy model to najlepszy wybór dla konkretnego użytku, a dokładne benchmarki pozwalają zaoszczędzić miliony na infrastrukturze AI bez straty na wydajności.