Zespół badaczy z arXiv wykazał, że transformery z warstwami feed-forward wykorzystującymi aktywacje GELU lub SiLU są podatne na nowy typ ataku polegający na analizie drugiej pochodnej (hessiana) danych wyjściowych modelu. Odkrycie jest zaskakujące, bo atak działa w scenariuszu black-box, bez jakiegokolwiek dostępu do wag sieci, gradientów czy aktywacji wewnętrznych - atakujący potrzebuje jedynie możliwości wywoływania modelu z wybranymi przez siebie wejściami i obserwacji surowych wyjść.

Metoda opiera się na obserwacji, że hessiane wejść (macierze drugich pochodnych) tworzą mieszaniny tych samych czynników symetrycznych, które zależy od wag warstwy feed-forward. Badacze sformalizowali ten problem jako rozkład częściowo symetryczny, pozwalając im na odzyskanie kierunków ukrytych neuronów. Wykorzystując optymalizację zaproponowaną metodę na transformerach wizyjnych trenowanych na CIFAR-10, naukowcy potrzebowali zaledwie 16 hessianów (odpowiadających 8193 zapytaniom) aby odzyskać kierunki neuronów z cosine alignment powyżej 0.94 dla większości neuronów - zarówno w sieciach z GELU (95.1 procent neuronów) jak i SiLU (91.9 procent).

Jeszcze bardziej alarmujące jest to, że odzyskana struktura umożliwia również pełną ekstraktywnie modelu. Utrzymując odzyskane kierunki neuronów i dopasowując jedynie pozostałe parametry, atakujący mogą stworzyć funkcjonalnie identyczną kopię modelu z ponad 93 procent dokładnością na testowych danych. Wynik ostaje wysoki niezależnie od tego, czy model był trenowany od nowa czy stosowano go wielokrotnie. To odkrycie stanowi poważne wyzwanie dla bezpieczeństwa modeli transformers i podkreśla konieczność opracowania nowych zabezpieczeń przed tego typu atakami.