Anthropic ujawnił szczegóły dotyczące funkcjonowania znaku wodnego w tekstach generowanych przez model Claude. Mechanizm ten pozwala na identyfikację i weryfikację autentyczności tekstu pochodzącego bezpośrednio z tego systemu AI.
Znak wodny nie jest widoczny dla użytkownika w tradycyjnym sensie, ale jest osadzony w wyborach leksykalnych i statystycznych generowanego tekstu. System pracuje poprzez subtelne wpływanie na rozkład prawdopodobieństwa tokenów podczas generowania, bez zauważalnego wpływu na jakość czy znaczenie wyprodukowanego tekstu. Podejście to stanowi innowacyjne rozwiązanie, ponieważ nie degraduje doświadczenia użytkownika ani nie modyfikuje widocznej treści.
Ta technologia ma kluczowe znaczenie w kontekście rosnącego problemu deepfakes'ów i sztucznej zawartości. Dzięki znakowi wodnemu można automatycznie weryfikować pochodzenie tekstu, co powinno ułatwić identyfikację treści generowanej przez AI i zmniejszyć rozprzestrzenianie się dezinformacji. Inne laboratoria AI eksperymentują z podobnymi podejściami, ale solution Anthropica wyróżnia się skupieniem na zachowaniu naturalności tekstu przy jednoczesnym osiągnięciu trwałości znaku wodnego.