Naukowcy wykryli niepokojący problem w bezpieczeństwie systemów AI - podczas dostosowywania modeli strażniczych do konkretnych zadań ich ochronna geometria ulega zapaści, co czyni je łatwymi do obejścia. Modele strażnicze to specjalne sieci trenowane do weryfikacji i blokowania niebezpiecznych działań agentów AI, ale okazuje się, że popularne metody fine-tuningu mogą paradoksalnie osłabiać ich efektywność zamiast ją poprawiać. Odkrycie to ma poważne konsekwencje dla bezpieczeństwa autonomicznych systemów AI wdrażanych w realnych aplicjach, gdzie takie przepaści mogą prowadzić do nieprzewidywalnych lub szkodliwych zachowań.

Podatność polega na tym, że w trakcie dostosowywania parametrów modelu bezpieczeństwa do nowych zadań zmienia się matematyczna struktura, na której opiera się jego zdolność do rozpoznawania i blokowania zagrożeń. Badacze wskazują, że konwencjonalne podejścia treningowe nie uwzględniają specyfiki tych modeli - skupiają się na dokładności, a ignorują to, jak zmienia się fundamentalna "geometria" systemu ochronnego. Problem jest szczególnie groźny w kontekście rosnącej złożoności agentów AI, które otrzymują coraz więcej autonomii w podejmowaniu decyzji i działań bez nadzoru człowieka.

To odkrycie stanowi wezwanie do redefinicji sposobów trenowania systemów bezpieczeństwa w AI. Zamiast stosować standardowe metody fine-tuningu, specjaliści muszą opracować techniki, które zachowują integralność ochronnej struktury modelu, nawet podczas jego dostosowywania. Problem wskazuje na lukę w obecnym podejściu do bezpieczeństwa systemów generatywnych - bezpieczeństwo nie może być dodawane posteriormente czy traktowane jako opcjonalne usprawnienie, ale musi być fundamentalnie wbudowane w architekturę modelu od samego początku.