Anthropic niespodziewanie wydało w piątek nowy model Claude Opus 5, który podnosi poprzeczkę w konkurencji między największymi modelami AI. Według oficjalnych benchmarków Opus 5 techniczne dorównuje modelowi Fable, chociaż Anthropic ostrożnie komunikuje to jako 'zbliżanie się' do wydajności konkurencji. Niezależne ewaluacje potwierdzają jednak, że model rzeczywiście go przegania, szczególnie w zadaniach związanych z kodowaniem i automatyzacją.co najistotniejsze z biznesowego punktu widzenia, Opus 5 kosztuje połowę ceny Fable, co zmienia ekonomikę korzystania z zaawansowanych modeli AI. Model osiągnął wynik ECI 159 w ocenie Epoch (Fable 5 ma 161) i równy wynik 161 w benchmarku SWE-ECI dla zadań programistycznych. Prawie równa wydajność przy znacznie niższej cenie to duży skok dla Anthropica w scenariuszu, gdzie użytkownicy coraz bardziej zwracają uwagę na efektywność kosztów.
Wydanie w piątek i zmieszane komunikaty ze strony Anthropica odzwierciedlają szerszy problem w branży - trudność w mierzeniu rzeczywistych możliwości modeli za pomocą dostępnych benchmarków. Chociaż formalne testy wskazują na zbliżoną wydajność, społeczność AI zgadza się, że Fable ma coś nienamacalnego, 'big model smell', co benchmarki nie potrafią wychwycić. Tymczasem praktyczne zastosowania, takie jak automatyzacja przeglądarki i agenty kodujące, pokazują Opus 5 w dobrym świetle. To wywołało ożywioną debatę na platformach X (dawniej Twitter) i Reddicie - użytkownicy testują model w rzeczywistych scenariuszach i dzielą się doświadczeniami z automatyzacją.