Together AI porównał wydajność modeli Kimi K3 i Claude Fable 5 na benchmarku DeepSWE, przeprowadzając 452 rolloutów dla każdego. Wyniki pokazały, że Claude Fable 5 osiąga lepszy wynik w metryce pass@1 (wskaźnik poprawności pierwszej próby), wygrywając przewagą 1,4 punktu. Jednak Kimi K3 radzi sobie lepiej przy pass@4, czyli gdy model ma cztery próby do rozwiązania problemu.
Najważniejszy wniosek dotyczy efektywności kosztowej - Kimi K3 dostarcza 2,8 raza więcej rozwiązań na każdy wydany dolar. To znacząca różnica dla zespołów inżynierskich, które muszą zabudżetować koszty automatyzacji kodowania. Podczas gdy Claude Fable 5 wykazuje lepsza dokładność w pierwszym podejściu, bardziej ekonomiczne podejście Kimi K3 może być bardziej praktyczne dla projektów wymagających skalowania.
Ten test podkreśla, że wybór modelu do kodowania nie powinien opierać się wyłącznie na surowych metrykaach dokładności. Kombinacja wydajności i kosztu operacyjnego staje się kluczowym czynnikiem dla zespołów szukających rentownych rozwiązań do wsparcia procesu tworzenia oprogramowania.