Naukowcy zaproponowali GAP-DPO, algorytm personalizacji modeli językowych, który rozwiązuje podstawowy problem istniejących podejść - słabą selekcję par treningowych w kontekście preferencji użytkownika. Direct Preference Optimization (DPO) pozostaje stabilnym frameworkiem do uczenia preferencji, ale jego efektywność w ustawieniach personalizowanych zależy krytycznie od tego, które pary zdań wybierze się do treningu.

Tradycyjne metody polegają na heurystykach takich jak skrajne wartości wiarygodności tekstu, które nie uwzględniają rzeczywistej użyteczności dla konkretnego użytkownika. Autorzy sformalizowali problem jako zagadnienie geometrycznej optymalizacji poprzez analizę pierwszego rzędu interakcji między gradientami oczekiwanej użyteczności a kierunkami aktualizacji DPO. Odkryli, że gdy marginesy preferencji są geometrycznie wyrównane z gradientami użyteczności, aktualizacja DPO przechodzi z czystego sygnału korekcji błędu do aktualizacji zbliżonej do reinforcement learningu.

GAP-DPO iteracyjnie wybiera pary treningowe z uwzględnieniem użyteczności i wyrównania geometrycznego, jednocześnie kontrolując rozbieżności w rozkładzie poprzez regenerację par w każdej epoce. Eksperymenty na benchmarkach generacji tekstu personalizowanego wykazały konsekwentne ulepszenia w wierności stylistycznej i dopasowaniu do preferencji użytkownika, co sugeruje znaczący potencjał metody dla bardziej zaawansowanych systemów AI dostosowanych do indywidualnych potrzeb.