Naukowcy z arXiv zbadali problem pluralistycznego wyrównania modeli AI - jak stworzyć systemy, które zamiast narzucać jedną perspektywę, mogą elastycznie dostosowywać się do konkurujących wartości i preferencji różnych użytkowników. Zespół analizował Multi-Objective Direct Preference Optimization (MODPO), technikę, która poprzez wagowanie celów pozwala przechodzić między różnymi kompromisami, i sprawdzali dwie kluczowe kwestie: kiedy model może jednocześnie poprawiać dwa cele, oraz jak pokryć wiele możliwych trade-offów bez trenowania osobnego modelu dla każdego.
Badania przeprowadzone na siedmiu parach celów z datasetów HelpSteer i UltraFeedback ujawniły interesujące różnice w możliwości przewidywania konfliktów. Dwa wskaźniki mierzone przed treningiem doskonale prognozowały, czy cele się wspierają czy są w konflikcie - ale tylko dla danych anotowanych przez ludzi. Dla danych oznaczonych przez AI-modele predykcja zawodła, ponieważ długość odpowiedzi i powtarzalność tekstów zniekształcały wyniki modeli reward.
Do zwiększenia pokrycia możliwych kompromisów zespół testował dwie strategie: wybieranie najbliższego już wytrenowanego modelu oraz łączenie parametrów modeli. Obie podejścia pomagały, ale żadne nie dorównywało konsekwentnie bezpośredniemu treningowi. Te ustalenia dają praktyczne wskazówki dla inżynierów pracujących nad sterowalnymi modelami AI, które mogą służyć użytkownikom o różnych wartościach i preferencjach.