Zespół badawczy przeanalizował fundamentalny problem w podejściach do bezpieczeństwa teksto-obrazowych modeli generatywnych takich jak Stable Diffusion czy DALL-E. Dotychczasowe mechanizmy ochrony opierają się na uniwersalnym "globalnym kierunku niebezpiecznym" - obiekcie geometrycznym w przestrzeni ukrytej modelu, który ma być blokowany dla wszystkich zapytań. Problem polega na tym, że takie globalne rozwiązania nie potrafią zadowolić sprzecznych wymagań: aby skutecznie chronić przed różnorodnymi typami niebezpiecznych treści, muszą być doskonale szerokie, co jednocześnie prowadzi do zablokowania wielu całkowicie bezpiecznych zapytań.
Mechanizm CALM wprowadza radykalnie inne podejście zwane prompt-lokalną korekcją kontrafaktyczną. Zamiast uniwersalnego usuwania, technika ta analizuje każde zapytanie indywidualnie, identyfikuje konkretne niebezpieczne kategorie związane z danym tekstem, a następnie przeprowadza minimalne edycje reprezentacji tokenów w kierunku bezpieczeństwa. System wykorzystuje pary "anchor" (związane ze sobą niebezpieczne i bezpieczne przykłady) do orientacji oraz selektywnie tłumi komponenty związane z niebezpieczną treścią, zachowując przy tym normalne funkcjonowanie modelu dla legalnych zastosowań.
Badania wykazały znaczną poprawę - CALM skutecznie redukuje generowanie szkodliwych treści jednocześnie lepiej zachowując użyteczność systemu dla zwykłych użytkowników. To stanowi istotny krok w rozwoju bardziej zaawansowanych mechanizmów bezpieczeństwa dla modeli generatywnych, odchodzących od prostych, globalnych podejść na rzecz bardziej wysofistykowanych rozwiązań kontekstowych.