Naukowcy stworzyli VSysBench, nowy benchmark do pomiaru, jak dobrze multimodalne duże modele językowe (MLLM) wykonują polecenia systemowe w kontekście obrazów. Problem jest istotny, bo w produkcji te modele coraz bardziej polegają na system messages do kontrolowania zachowania, a istniejące benchmarki albo oceniają tylko tekst, albo nie mierzą tego w kontekście multimodalnym. VSysBench organicuje ograniczenia w 22 podkategoriach, od tekstowych dyrektyw w kontekście wizualnym do w pełni wizualnych, każde z misaligned odpowiednikami do stresstestowania hierarchii instrukcji.
Badanie obejmowało 16 MLLM - zarówno modele open-weight jak i proprietary top-tier'owe. Każdy response oceniano wzdłuż dwóch osi: compliance z ograniczeniami (JSR - Joint Satisfaction Rate) i poprawność odpowiedzi (CCS - Cross-Constraint Sensitivity). Wyniki okazały się zaskakujące: nałożenie system messages znacznie obniża dokładność bazowych zadań wizyjno-językowych, compliance modeli open-source załamuje się pod presją konfliktu między poleceniami systemowymi a instrukcjami użytkownika, podczas gdy top proprietary modele pozostają stabilne. Ograniczenia oparte całkowicie na widzeniu okazały się najnajtrudniejszą kategorią dla każdego testowanego modelu.
To badanie ma znaczenie dla bezpieczeństwa i niezawodności MLLM w praktycznych zastosowaniach. Pokazuje, że current modele mają problem z utrzymaniem instrukcji kontrolnych gdy wchodzą w konflikt z instrukcjami użytkownika, szczególnie w modelach open-weight. To sugeruje, że różne rodzaje modeli wymagają innego podejścia do kontrolowania zachowania poprzez system messages, a obecne podejścia mogą obniżać zmianę wydajności na zadaniach wizyjno-językowych.