Naukowcy z arXiv wprowadzili GRASP - metodę umożliwiającą małym modelom językowym anonimizowanie tekstu lokalnie, bez konieczności przesyłania go do zewnętrznych serwisów. Problemem przy dotychczasowych podejściach była potrzeba użycia potężnych modeli do anonimizacji, co zmuszało użytkowników do wysyłania prywatnych tekstów do trzeciej strony - dokładnie tego, co anonimizacja miała zapobiec.
GRASP zmienia to podejście poprzez trenowanie pojedynczego modelu Llama-3.1-8B w trzech rolach jednocześnie: anonimizatora tekstu, przeciwnika próbującego wydobyć dane osobowe oraz arbitra ocenienia użyteczności. System używa Group Relative Policy Optimization zamiast Direct Preference Optimization - zamiast po prostu naśladować offline wybory nauczyciela, bezpośrednio optymalizuje prawdziwy cel: chowanie atrybutów (wiek, lokalizacja, zawód) przy zachowaniu znaczenia tekstu. Design zawiera również zabezpieczenia przed reward hacking.
Wyniki pokazują, że GRASP lepiej balanuje między prywatnością a jakością tekstu niż wcześniejszy baseline oparty na DPO, konsekwentnie w ewaluacji przez trzech niezależnych sędziów LLM. Co ważne, metoda osiąga porównywalne lub lepsze rezultaty ogólne w stosunku do anonimizacji napędzanej modelami frontowymi jak Gemini 2.5 Flash i Claude 3.5 - tyle że bez przesyłania danych do chmury.