Dwaj niezależni deweloperzy - Peter James i Jonny L. Saunders - zdołali nakłonić model Muse od Mety do udostępnienia całej zawartości jego systemu plików, włączając pliki jądra Ubuntu i dokumentację wewnętrzną. Saunders potwierdził na platformie Mastodon, że replikacja wyników James'a była niezwykle łatwa, a Muse wykazywał prawie żadną odporność na prompt injection.

Model Muse działa w trwałych wirtualnych maszynach Linux dla każdego użytkownika, co mogło ułatwić dostęp do takich wrażliwych danych. Fakt, że zarówno James jak i Saunders niezależnie odkryli tę metodę przy minimalnym nacisku, sugeruje, że nie była to trudna exploitacja wymagająca zaawansowanej wiedzy.

Meta oficjalnie zanegowała, że incydent stanowi naruszenie bezpieczeństwa, jednak odkrycie ujawnia poważne luki w architekturze bezpieczeństwa modelu. Dla branży AI to kolejny sygnał, że modele działające w wyizolowanych środowiskach mogą nieoczekiwanie ujawniać strukturę swoich systemów, co budzi pytania o bardziej fundamentalne problemy w odporności współczesnych dużych modeli na ataki typu prompt injection.