Naukowcy opublikowali nową metodę umożliwiającą zmianę zachowania agentów uczenia ze wzmacnianiem w kierunku celów fairness'u bez konieczności przetreniowania modelu. Zamiast tego system działa na etapie wnioskowania, bezpośrednio modyfikując prawdopodobieństwa wyboru akcji na podstawie wyników dobrobytu związanych z każdym potencjalnym działaniem.

Problem jest praktycznie ważny - w istniejących podejściach do fairness'u w RL preferencje interesariuszy muszą być znane z góry, a każda zmiana wymaga całkowitego przetreniowania agenta. To ogranicza elastyczność wdrożonych systemów. Inspirując się technikami alignment'u w dużych modelach języka, zespół sformalizował problem jako zagadnienie kształtowania polityki, opracowując framework mnożnikowy, który nie wymaga modyfikacji parametrów podstawowego modelu.

Według badaczy zaproponowany system jest ogólny i kompatybilny z dowolnymi głębokimi agentami RL. Ekstensywne eksperymenty across multiple domain'ów wykazały, że takie dostosowanie w czasie wnioskowania znacząco poprawia cele związane z uczciwością na podstawie dobrobytu, jednocześnie zachowując wydajność w podstawowym zadaniu. To podejście otwiera możliwość dynamicznego dostosowywania zachowania istniejących systemów AI do różnych preferencji użytkowników bez kosztownego przetreniowania.