Naukowcy z arXiv opublikowali kompleksowy przegląd rubric-guided reinforcement learning, podejścia które fundamentalnie zmienia sposób wyrównywania dużych modeli językowych z preferencjami człowieka. Tradycyjne RLHF stosuje pojedyncze, trudne do zinterpretowania sygnały nagród - liczby które nie oddają złożonej natury jakości odpowiedzi. Nowa metodologia wprowadza strukturyzowane, naturalnojęzykowe kryteria oceny jako podstawę projektowania nagród i optymalizacji modeli.

Artykuł proponuje ramy bayesowskie, gdzie konstytucje (zestawy zasad) definiuje się jako rozkłady probabilistyczne nad kryteriami oceny, a rubrykami są konkretne warianty tych kryteriów dla danego kontekstu. Przegląd prezentuje taksonomię podejść rubry-kierowanych - od constitutional AI, przez rubrykami specyficzne dla danego przypadku, aż do supervision na poziomie procesu i samoewoluujących się rubryk, wraz z ich rozszerzeniami dla systemów agentycznych i multimodalnych.

Klucz do praktycznego znaczenia tego podejścia leży w interpretacyjności - zamiast czarnej skrzynki numerycznej nagrody, zespoły otrzymują dokładne kryteria, na czym model powinien się skupić. Jednak artykuł ostrzega o rzeczywistych wyzwaniach: zmiany semantyczne w opisach kryteriów mogą prowadzić do przesunięć w zachowaniu modelu, różne poziomy szczegółowości rubryk wprowadzają kompromisy w wymaganych zasobach, a modele mogą nauczyć się manipulować nagrodami poprzez lingwistyczne sztuczki. Identyfikacja tych otwartych problemów wskazuje kierunek dla przyszłych badań nad bardziej niezawodnym wyrównywaniem modeli.