Znakowanie tekstu generowanego przez AI polega na osadzeniu nieuwidocznionych znaczników w tekście poprzez manipulowanie prawdopodobieństwem wyborów tokenów dokonywanych przez model. Zamiast losować słowa całkowicie swobodnie, algorytm znakowania wpływa na to, które wyrazy są wybierane, jednocześnie utrzymując naturalność i spójność tekstu. Czytelnicy nie widzą różnicy, ale detektor może rozpoznać charakterystyczną statistyczną strukturę tekstu i potwierdzić, że pochodzi z konkretnego modelu AI.

Technika ta jest szczególnie ważna w kontekście rosnących obaw o wiarygodność informacji online. Znakowanie tekstu może pomóc zidentyfikować zawartość generowaną przez AI i odróżnić ją od pracy człowieka, co jest cenne dla edukacji, mediów i ochrony przed plagiami. OpenAI i inne firmy eksplorują takie rozwiązania jako część swoich strategii bezpieczeństwa i przejrzystości.

Jednak znakowanie nie jest nieprzenikalnym zabezpieczeniem. Tekst można przeformułować, przepisać lub opracować na kilka sposobów, aby usunąć znaki wodne. Ponadto atakujący mogą próbować sfałszować znakowanie, twierdząc że zwykły tekst pochodzi z AI. Dlatego znakowanie jest raczej narzędziem wspomagającym niż ostatecznym rozwiązaniem, wymagającym uzupełnienia innymi metodami weryfikacji.