Zespół badaczy opracował metodę Private Best-of-N (PrivBoN), która dodając skalibrowany szum do wyników funkcji nagród, jednocześnie chroni prywatność wrażliwych danych preferencji użytkowników i rozwiązuje problem reward hackingu, gdzie model wykorzystuje błędy funkcji oceny. Gdy budżet prywatności przekracza krytyczną próg, szum wymagany przez bezpieczeństwo prywatności okazuje się być optymalnym regularyzatorem wyrównywania modelu - co oznacza, że prywatność nie kosztuje nas w postaci obniżenia jakości.

Standardowa metoda Best-of-N sampling wybiera z kilku wygenerowanych odpowiedzi tę, której przyznana nagroda jest najwyższa. Problem w tym, że funkcja nagród może mieć błędy, a model może się tego nauczyć i je wykorzystać. Dodatkowo dane preferencji ludzkich używane do treningu funkcji nagród są czułym materiałem osobowym. Nowa metoda PrivBoN zastępuje te problemy jednym eleganckim rozwiązaniem - dodaje szum Gumbela do wyników nagród zanim wybierze odpowiedź.

Dalszy krok, Private Inference-Time Pessimism (PrivITP), łączy rejection sampling z mechanizmem Gaussa, uzyskując gwarancje różniczkowej prywatności, które nie zależą od liczby wygenerowanych opcji do wyboru. Badacze testowali swoją metodę na różnych modelach językowych, zbiorach danych i funkcjach nagród, potwierdzając że osiąga ona teoretyczne optimum opisane wcześniej w literaturze naukowej.