Naukowcy z arXiv opisali nową klasę ataków na neuronowe operatory równań różniczkowych cząstkowych - tzw. wrong-physics backdoors. Atak polega na zatruwaniu danych treningowych w taki sposób, że wyzwalany przez specjalny wzór wejściowy model zwraca ważne rozwiązanie PDE, ale dla błędnych parametrów fizycznych. Wynik wygląda fizycznie sensownie, ale rozwiązuje zupełnie inny problem niż zamierzony.

Zagrożenie wynika z niedostatecznej kontroli pochodzenia parametrów w archiwach treningowych, które przechowują już wyliczone rozwiązania dla wielu konfiguracji. Atakujący tworzy "odciśnięcie" na wejściu i przekierowuje nadzór treningowy na wyliczone wcześniej rozwiązanie dla innego parametru z tej samej rodziny równań. Badacze testowali atak na 476 kampaniach obejmujących równanie Burgersa, advection-diffusion, dwuwymiarowe Navier-Stokes i równanie Poissona. Fourier Neural Operators i DeepONet osiągnęły 100 proc. skuteczność na równaniach advection-diffusion i Navier-Stokes przy jednoczesnym utrzymaniu niskiego błędu na czystych danych.

Otwarcie pokazuje krytyczną lukę w procesach walidacji: sprawdzenie gładkości wyników lub ogólnego zachowania podobnego do solwera jest niewystarczające. Modele neuronowe mogą wyglądać niezawodnie, ale bez pełnej kontroli historii każdego parametru w danych treningowych, mogą skrywać zmianę interpretacji wejścia na poprzednio wyliczone, ale fizycznie obcą odpowiedź.