Together AI przeprowadził kompleksowe porównanie dwóch czołowych modeli na benchmarku DeepSWE, testując ich wydajność w rozwiązywaniu problemów programistycznych. Wyniki pokazują istotny rozdział między wydajnością a kosztem: Claude Fable 5 lepszy w pass@1, ale DeepSeek V4 Pro 0813 oferuje lepszy stosunek jakości do ceny.
W praktyce oznacza to, że wybór między modelami zależy od priorytetu. Jeśli zależy ci na pojedynczej, najlepszej odpowiedzi (pass@1), musisz wybrać droższego Claude'a - ale płacisz za to 90 razy więcej. Jeśli jednak pozwolisz modelowi wygenerować cztery próby (pass@4), DeepSeek V4 Pro wychodzi lepiej. To pokazuje siłę modeli otwartych w scenariuszach, gdzie można eksperymentować wielokrotnie bez bankructwa.
Najciekawsza część? Cascade routing z priorytetem Pro osiągnął 82,7% - to praktyczne rozwiązanie, które najpierw próbuje tańszego DeepSeek, a przy potrzebie przełącza na droższe opcje. Taki hybrydowy podход pozwala startupom i małym zespołom na dostęp do wydajności porównywalnej z flagowymi modelami bez gigantycznych rachunków.