Naukowcy z zakresu sztucznej inteligencji badali fundamentalny problem: jak sieci neuronowe takie jak Vision Transformers mogą nauczyć się rozumieć pojęcia abstrakcyjne, gdy dane treningowe zawierają mało bezpośrednich przykładów takich pojęć. Zamiast szukać bezpośredniego odzwierciedlenia abstrakcji w obrazach, zespół odkrył, że modele wykorzystują mechanizm metonimii - polegają na konkretnych pojęciach pomocniczych jako mostkach między sygnałami wizualnymi a znaczeniami abstrakcyjnymi.
Badacze zastosowali Transcodery na enkoderach wizualnych CLIP i DINO, aby zidentyfikować pośrednie cechy związane z bardziej konkretnymi pojęciami. Eksperymentu przeprowadzono na starannie wyselekcjonowanym zbiorze ikon, który ujawnił logicznie zorganizowane metonymiczne obwody. Okazało się, że pierwsze warstwy sieci dominują pierwotne elementy percepcyjne, następnie pojawiają się przedmioty będące pojęciami anchorami, które ostatecznie prowadzą do rozpoznania celów abstrakcyjnych. W przypadku ikon zawierających renderowany tekst model aktywuje zupełnie inną ścieżkę - przechodzącą od percepcji do tekstu.
Interwencje przyczynowe przeprowadzone w ramach badań potwierdziły, że te pośrednie pojęcia metonimiczne aktualnie uczestniczą w procesie ugruntowania pojęć abstrakcyjnych. Odkrycie jest istotne dla zrozumienia, jak transformery wizualne kodują i przetwarzają wiedzę semantyczną, co może mieć implikacje dla interpretowności sztucznej inteligencji i projektowania lepszych systemów multimodalnych.