Artykuł naukowy opublikowany na arXiv zajmuje się bezpieczeństwem multimodalnych dużych modeli językowych, których architektura łączy tekst, obrazy i inne dane w jeden spójny system. Ta integracja różnych typów informacji tworzy nowe słabe punkty, których nie mają modele pracujące z jednym typem danych.
Badacze identyfikują trzy główne kategorie zagrożeń specyficznych dla MLLM. Pierwsza to skompromitowana integracja modalności, druga to niesynchronizacja między modalnościami, a trzecia to połączone ryzyka bezpieczeństwa wynikające z fuzji danych. Tradycyjne ataki takie jak adversarial attacks, poisoning danych czy jailbreaki działają inaczej w systemach multimodalnych, bo mogą być ukryte w jednej z modalności a aktywne w innej. Halucynacje też przybierają nową postać, gdy model otrzymuje sprzeczne informacje z różnych źródeł.
Autorzy artykułu podkreślają, że obecne ramy bezpieczeństwa zostały zaprojektowane dla pojedynczych typów danych i nie uwzględniają złożoności interakcji między modalnościami. Przeprowadzają systematyczną klasyfikację powstających zagrożeń i omawiają nowe strategie ochrony, które są potrzebne aby uczynić systemy multimodalne bezpieczniejszymi. To badanie jest kluczowe dla przyszłości zaawansowanych modeli AI, zwłaszcza że takie systemy coraz bardziej dominują rynek.