Naukowcy z inicjatywy PoVisLE stworzyli pierwszy polski benchmark dedykowany ewaluacji modeli vision-language w kontekście zrozumienia osadzonego kulturowo. Dataset zawiera 1117 obrazów oraz 2366 ręcznie anotowanych par pytań i odpowiedzi wizualnych, stanowiąc kontrolowaną i zarazem wymagającą zasobów do testowania rzeczywistych umiejętności modeli w polskim kontekście kulturowym.
Obecne modele vision-language takie jak GPT-4V czy Llava osiągają imponujące wyniki na zadaniach takich jak Image Captioning czy Visual Question Answering, jednak zostały przeważnie wytrenowane na danych angielskojęzycznych i zachodnych. Taki układ powoduje, że modele źle interpretują regionalne znaczenia, treści symboliczne i kontekstowe wskazówki wizualne specyficzne dla danej kultury - na przykład polski folklor, historyczne referencje czy lokalne symbole.
Istniejące benchmarki dla kompetencji kulturowych są często oparte na szablonach i skupiają się na powierzchownym rozpoznawaniu, bez głębokich testów lingwistycznych i pragmatycznego zrozumienia. PoVisLE podejmuje inny podход - w grounded evaluation paradigm, gdzie język interpretuje się w interakcji z kontekstem wizualnym, co pozwala ocenić nie tylko czy model widzi obraz, ale czy faktycznie rozumie jego kulturowe znaczenie. Benchmark staje się ważnym narzędziem do mierzenia postępu w kierunku bardziej uniwersalnych modeli AI, zdolnych do pracy poza bańką anglojęzyczną.