Badacze bezpieczeństwa wykorzystali Claude od Anthropic do tego, by zaatakować i przejąć kontrolę nad systemami OpenAI. Atakujący przechwycili konta pracowników oraz uzyskali dostęp do wewnętrznego repozytorium kodu przed zgłoszeniem vulnerabilites odpowiedzialnym stronom.
Incydent stanowi ciekawy przykład tego, jak zaawansowane modele AI mogą być wykorzystywane do odkrywania i eksploatacji luk w bezpieczeństwie systemów informatycznych. Claude okazał się skutecznym narzędziem do automatyzacji procesów hakowania, co podkreśla zarówno potencjał, jak i zagrożenia związane z dostępem do takich technologii. Badacze działali w duchu odpowiedzialnego ujawnienia, informując OpenAI o problemach zamiast je eksploatować.
To zdarzenie zwraca uwagę na fakt, że firmy rozwijające modele sztucznej inteligencji muszą skupić się na wzmacnianiu własnego bezpieczeństwa infrastruktury. Ponieważ coraz potężniejsze modele AI stają się bardziej dostępne, również zagrożenia związane z ich nieautoryzowanym użyciem do ataków mogą rosnąć. Jednocześnie kontrolowane testy penetracyjne z użyciem takich narzędzi mogą pomóc firmom zidentyfikować i naprawić podatności zanim zostaną wykorzystane przez złośliwych aktorów.