Sieci neuronowe mogą w nieoczekiwany sposób mieszać i przeorganizowywać swoje wewnętrzne reprezentacje, co prowadzi do niestabilnych decyzji i błędów. Badacze zidentyfikowali głęboką słabość w architekturze modelów AI - to, co wygląda na solidnie wyuczone cechy, okazuje się być podatne na gwałtowne zmiany w strukturze bez widocznego powodu. Problem dotyczy tego, jak sieci neuronowe komponują Features - czyli elementarne składniki wiedzy - w bardziej złożone koncepty potrzebne do rozwiązywania skomplikowanych zadań. Zamiast stabilnie budować na sobie warstwę po warstwie, model czasem reorganizuje całą wewnętrzną strukturę, co destabilizuje jego działanie.
To odkrycie ma poważne konsekwencje dla bezpieczeństwa AI, szczególnie gdy chodzi o systemy krytyczne. Modele, które wyglądają na dobrze wytrenowane w laboratorium, mogą nagle zawodzić w rzeczywistych warunkach, gdy napotykają dane nieznacznie odbiegające od warunków treningowych. Niestabilność strukturalna oznacza, że tradycyjne testy nie wychwycą wszystkich potencjalnych punktów zagrożenia - model może działać prawidłowo w kontrolowanych warunkach, a potem zupełnie odmiennie na produkcji. To szczególnie problematyczne dla aplikacji w medycynie, autonomicznych pojazdach czy systemach bezpieczeństwa.
Odkrycie podkreśla brakujące fundamenty w naszym rozumieniu głębokich sieci neuronowych. Nie wiemy dokładnie, kiedy i dlaczego dochodzi do takich reorganizacji, co utrudnia tworzenie bardziej niezawodnych modeli. Naukowcy pracują nad sposobami zbadania i potencjalnie wyeliminowania tego problemu, ale jest to głębokie wyzwanie metodologiczne - wymaga zmiany sposobu, w jaki projektujemy i trenujemy AI. Na razie jedno jest pewne: nie możemy biernie ufać temu, co mówią nam metryki ewaluacyjne.