Zespół Mosaic ML udokumentował podatność o nazwie MosaicLeaks, która ujawnia, jak agenty AI mogą nieumyślnie ujawniać wrażliwe informacje podczas wykonywania zadań badawczych. Problem polega na tym, że agenty ta otrzymują dostęp do wielu dokumentów - zarówno publicznych jak i poufnych - i podczas pracy mogą przypadkowo przywołać dane, które powinny pozostać tajne. Dzieje się to szczególnie wtedy, gdy model jest proszony o generowanie tekstu lub podsumowania na bazie przeczytanych materiałów.

Uderzające w to odkrycie zaburza ideę, że agenty badawcze mogą bezpiecznie pracować w środowiskach zawierających informacje wrażliwe. Tradycyjnie zakładano, że modele językowe przetworzyć mogą treść bez ryzyka jej ujawnienia, ale badania pokazują, że w praktyce agenty reagują na pytania w sposób, który może wyciągnąć ukryte wcześniej informacje na powierzchnię. Problem jest szczególnie ostry dla organizacji, które chcą wdrożyć AI do pracy z dokumentami zawierającymi sekrety biznesowe, dane osobowe czy informacje poufne.

Odkrycie to ma poważne implikacje dla bezpieczeństwa, architektur systemów AI oraz wymagań compliance w branżach gdzie ochrona danych jest krytyczna. Pokazuje, że zwyczajne filtry bezpieczeństwa i ograniczenia dostępu mogą nie wystarczać - potrzebne są nowe, bardziej zaawansowane podejścia do izolacji informacji wrażliwych w systemach z agentami.