Claude Fable 5.1 od Anthropic już dostępny - firma ogłosiła nową wersję jako przełom dla pracy nad kodem, knowledge work i długotrwałych problemów. Na benchmarku Terminal-Bench-Science 0.1 model osiągnął 52,6 procent, znacznie więcej niż Fable 5 z 24,7 procent, Opus 5 z 29,0 procent czy GPT-5.6 Sol z 22,4 procent.

Simon Willison, badacz AI, postanowił przetestować model poprzez swój osobisty "pelican benchmark" - серию promptów mających wygenerować animowane pelikany. Fable 5.1 oferuje pięć poziomów intensywności rozumowania: low, medium, high, xhigh i max. Willison odkrył fascynujące zjawisko: na poziomie low model zwracał wyjścia bez widocznych śladów summarized reasoning tokenów, despite tradycyjnie oczekiwanych zachowań modelu.

Badacz zauważa, że historycznie pelican benchmark dobrze korelował z ogólnymi możliwościami modeli, ale ta korelacja osłabła od 2025 roku. Obecnie największą wartość benchmark dostarcza przy porównywaniu różnych poziomów reasoning effort w ramach tej samej rodziny modeli, ujawniając subtelne różnice w sposobie działania w zależności od ustawień intensywności.