CogArena to nowy benchmark proceduralne generowany z 13 paradygmatów testowych, który ma na celu zweryfikować, czy wyniki w zadaniach kognitywnych rzeczywiście odzwierciedlają odrębne wymiary zdolności mentalnych w modelach językowych. Badacze przeanalizowali 55 modelów open-weight i zbadali, czy poszczególne wymiary poznawcze (podzielone na pięć teoretycznie uzasadnionych grup) rzeczywiście się rozdzielają i odpowiadają na wprowadzane interwencje.

Wynikiczeńskiej studii są nieco zaskakujące dla miłośników strukturalnych interpretacji. Prawie wszystkie korelacje między paradygmatami okazały się pozytywne, a jedna wspólna oś wyjaśniła około połowy wariancji - to sugeruje bardziej jednolitą strukturę niż teoretyczne pięć wymiarów. Przewaga punktacji w ramach poszczególnych grup była mała, wrażliwa na metodę scoringu i niespójna między rodzinami modeli. W zaplanowanej osobno potwierdzającej studii na 12 modelach z sześciu rodzin zastosowane scaffoldy pokazały jedynie nieznaczną przewagę w dopasowanych grupach, a żaden efekt nie przetrwał korekty na wielokrotne testowanie.

Najważniejsze znalezisko jest ostrożne: theo-aligned prompting wytworzył niewielką tendencję przekątną w baterii testów, ale obecne dowody nie ustanawiają stabilnych pięciowymiarowych profili zdolności kognitywnych. CogArena dostarcza metodologię łączącą podpisy behawioralne, analizę kowariancji, interwencje dopasowane i predykcję poza rodzinami modeli - zanim etykiety kognitywne będą przypisane wynikom.