Naukowcy opracowali nowatorską metodę Orthogonal Concept Erasure (OCE), która pozwala wymazywać niechciane koncepty z modeli dyfuzyjnych bez uszkadzania ich zdolności generacyjnych. Technika bazuje na ortogonalnych transformacjach, które precyzyjnie izolują i eliminują wybrane pojęcia z przestrzeni latentnej modelu - innymi słowy, z wewnętrznego wszechświata, w którym AI przechowuje wiedzę o świecie. To rozwiązanie otwiera nowe możliwości kontroli zawartości, którą generują zaawansowane systemy AI, oraz podnosi poziom bezpieczeństwa generatywnych narzędzi sztucznej inteligencji.
Problem, przed którym stali naukowcy, jest fundamentalny dla rozwoju odpowiedzialnej AI. Modele dyfuzyjne - ta sama technologia, która napędza generatory obrazów takie jak Stable Diffusion czy DALL-E - mogą reprodukować problematyczne treści, od uprzedzeń społecznych po nilegalne materiały. Dotychczasowe próby usunięcia takich konceptów zwykle polegały na brutalnym wymazywaniu fragmentów modelu lub przeuczu całych danych, co prowadziło do obniżenia jego wydajności i jakości generowanych wyników. Metoda OCE rozwiązuje ten dylemat, działając jak chirurgiczny scalpel zamiast toporu.
Ortogonalne transformacje działają na zasadzie geometrycznej - wyobraź sobie, że koncepty w modelu istnieją w przestrzeni wielowymiarowej, gdzie każdy kierunek reprezentuje inną ideę. Metoda OCE znajduje kierunki związane z niechcianym konceptem i całkowicie je blokuje, ale nie ingeruje w pozostałą część modelu. To pozwala na selektywne usuwanie - na przykład można wyeliminować zdolność generowania pewnych typów obrazów, pozostawiając wszystkie inne funkcje bez zmian. Dla branży AI to przełom, bo oznacza możliwość stworzenia bezpieczniejszych systemów bez straty miliardów parametrów modelowych na których inwestowali twórcy. Metoda ma również potencjał w budowaniu systemów zgodnych z lokalnymi przepisami - rozmaite kraje mogą usuwać koncepty niezgodne z ich regulacjami bez konieczności trenowania całkowicie odrębnych wersji modeli.