Naukowcy opracowali CreativityBench - pierwszy kompleksowy benchmark mający mierzyć, jak kreatywnie myślą agenci AI. System testuje inteligencję poprzez zadania z repurposingiem narzędzi, czyli wykorzystywaniem dostępnych zasobów w niezwykłych, niekonwencjonalnych celach. To okazuje się kluczowe, bo pokazuje, czy modele potrafią myśleć poza szablonami i elastycznie podchodzić do problemów, a nie tylko polegać na memoryzacji wzorców z danych treningowych.

Benchmark bada zdolność do twórczego rozwiązywania sytuacji, w których standardowe podejście nie wystarczy. Testuje, czy agent potrafi na przykład wykorzystać narzędzie przeznaczone do jednego celu do czegoś zupełnie innego, albo odkryć nieoczywistą kombinację dostępnych zasobów. To fundament prawdziwej inteligencji - umiejętność znalezienia nowego sposobu, gdy stare nie działają.

Wprowadzenie CreativityBench ma znaczenie dla całego pola AI. Dotychczasowe benchmarki fokusują się na dokładności i szybkości, ale pomijają elastyczność myślenia. Nowe narzędzie powinno napędzać rozwój modeli zdolnych do rzeczywistej innowacyjności, co przybliża nas do systemów mogących sprawdzić się w rzeczywistych, nieprzewidywalnych sytuacjach, a nie tylko w laboratoriach.