Zespół naukowców zaprezentował DiSCO, nową metodę obrony dla generatorów tekst-obraz, która działając wyłącznie na poziomie promptu potrafi zmniejszyć generowanie szkodliwych treści nawet o 37,7 procent. System jest całkowicie black-box, co oznacza, że nie wymaga dostępu do wag modelu, jego reoptymalizacji ani fine-tuningu - stanowi osobny moduł, który można podpiąć do istniejących systemów.
Problem, który rozwiązuje DiSCO, to tzw. benign adversarial attack - sytuacja, gdy prompt brzmi bezpiecznie z punktu widzenia języka, ale model gen(e)ruje mimo tego niebezpieczne obrazy ze względu na swoją wytrenowaną dystrybucję danych. Istniejące dotychczas rozwiązania wymagały dostępu do wewnętrznych części modelu lub polegały na przepisywaniu promptów przez LLM-y, co było mniej efektywne. DiSCO zamiast tego wykonuje beam search z iteracyjnym doskonaleniem, porównując wyniki przy użyciu contrastive scoring opartego na bezpiecznych i niebezpiecznych obrazach generowanych przez sam model docelowy.
Metoda testowana na benchmarku I2P wykazała poprawę bezpieczeństwa zarówno dla modelów już mających obronę, jak i całkowicie niechronionych, przy jednoczesnym zachowaniu wierności semantycznej promptów i poprawie koherencji wynikowych obrazów. Szczególnie ważne jest, że DiSCO nie wymaga informacji o architekturze ani parametrach modelu, co czyni ją przydatną dla systemów proprietary, do których badacze nie mają bezpośredniego dostępu.