Naukowcy z arXiv CS.AI opracowali C4, innowacyjny framework do oceny kreatywności modeli multimodalnych (MLLM) w kontekście rozumienia relacji między koncepcjami. Framework, oparty na chińskich idiomach chengyu, rozwiązuje problem braku standardowych testów dla umiejętności kreatywnych - dziedziny, gdzie jawne cele i sygnały nagrodzenia są rzadkie w porównaniu z zadaniami mierzącymi dokładność.

C4 operacjonalizuje proces jako kodowanie i dekodowanie koncepcji poprzez ręcznie anotowaną sieć cross-concept z wyraźnie zdefiniowanymi ścieżkami łączącymi koncepty. Zestaw C4-Eval zawiera 184 syntetyczne przykłady oraz 37 figur idiomatycznych stworzonych przez ludzi, rozlokowanych w pięciu różnych formatach zadań - łącznie 884 przypadków testowych. Trudność każdego elementu jest indeksowana liczbą mostów koncepcyjnych i ich głębokością.

Wyniki pokazują znaczące wyzwania - najlepsze modele zamknięte takie jak GPT-4 osiągnęły zaledwie 50,7 procent dokładności, podczas gdy modele otwarte 48,0 procent. To wskazuje, że kreatywne rozumienie koncepcji, będące kluczową umiejętnością poznawczą, pozostaje słabą stroną współczesnych MLLM. Framework stanowi ważny krok w kierunku bardziej holistycznej oceny możliwości modeli nie tylko w zakresie dokładności faktycznej, ale też w zdolnościach wymagających myślenia twórczego i rozumienia nieintuicyjnych powiązań.