Tradycyjne podejście do wyrównania dużych modeli językowych z preferencjami człowieka (RLHF) opiera się na statycznych modelach nagród, które nie uwzględniają specyfiki konkretnego zadania. Ten brak dostosowania skutkuje rzadkimi sygnałami uczenia i suboptymalnymi wynikami wyrównania. MeRLa zmienia to podejście poprzez meta-uczenie się funkcji kształtowania nagród, która jest adaptacyjna dla każdego zadania.

Metoda działa w dwóch etapach. Najpierw system meta-uczy się funkcji Φ(x,y;φ) na zbiorze zadań pomocniczych, łącząc dyskryminację zadań, regularyzację entropii i zachowanie potencjału dla stabilnej konwergencji. Następnie ta nauczona funkcja zmienia postać nagród podczas głównego treningu RLHF, dostarczając dostosowanych do konkretnego zadania sygnałów uczenia. Kluczową zaletą jest to, że метод zachowuje optymalność polityki modelu - funkcja reward shaping nie zmienia tego, jakie decyzje są ostatecznie najlepsze.

Eksperymenty na LLaMA-3-8B przebiegły na czterech benchmarkach z imponującymi wynikami. MeRLa uzyskała 90,8% win rate na AlpacaEval 2.0 (przy kontroli długości odpowiedzi) i wynik 9,14 na MT-Bench, jednocześnie zmniejszając niestabilność treningu o 41% w stosunku do standardowych metod. Co szczególnie ważne, podejście zachowuje swoje korzyści nawet przy kombinacji z nagrodami opartymi na procesie lub rubryczkach oceny, co sugeruje jego uniwersalność i praktyczność w rzeczywistych scenariuszach.