Artykuł-stanowisko opublikowany na arXiv zwraca uwagę na niebezpieczny paradoks w pracy nad alignment'em AI. Metody, które mają chronić przed szkodliwymi rezultatami, mogą zostać zwrócone przeciwko użytkownikom przez złośliwych aktorów w celu cenzury, manipulacji i narzucenia dominacji informacyjnej.

Autorzy mapują obecne techniki alignment'u do rzeczywistych przypadków ich niewłaściwego wykorzystania. Pokazują, że im bardziej "idealnie wyrównany" model, tym skuteczniejszym narzędziem staje się dla tych, którzy chcieliby go wykorzystać do kontroli przepływu informacji. Problem nabiera szczególnej ostrości w kontekście szybkiego wzrostu liczby użytkowników polegających na AI jako źródle informacji, asymetrii mocy ekonomicznej między graczami oraz globalnych trendów autorytarnych.

Badacze wzywają społeczność AI do merytorycznej dyskusji nad dual-use potential'em alignment'u i proponują strategie mitygacyjne mające zabezpieczyć przed niewłaściwym wykorzystaniem. Stanowisko sygnalizuje, że niewystarczy zapobiegać samym szkodliwym wynikom - trzeba również myśleć o tym, kto i jak może przechwycić nasze narzędzia bezpieczeństwa.