Naukowcy opracowali Tail-Likelihood Reinforcement Learning (TailRL), metodę która zmienia fundamentalne podejście do optymalizacji w uczeniu ze wzmacnianiem. Zamiast skupiać się wyłącznie na średniej nagrodzie, nowy algorytm maksymalizuje logarytm prawdopodobieństwa przekroczenia losowo wybranego progu nagrody. To oznacza, że każdy możliwy próg nagrody traktowany jest jako osobne zadanie klasyfikacji binarnej (tak-nie).

Problemy, które rozwiązuje TailRL, są praktycznie istotnymi dla systemów generatywnych. Dwie polityki mogą osiągać identyczną średnią nagrodę, ale mieć całkowicie różne szanse na wygenerowanie rzadkiego, ale wysokiej jakości wyniku. W praktyce treningowej i inferencyjnej ta różnica nabiera znaczenia, bo im więcej próbek zostaje wylosowanych, tym bardziej warte jest zachowanie masy prawdopodobieństwa na wysokiej-nagrody rezultatach. TailRL bezpośrednio optymalizuje tę zawartość ogonów rozkładu.

Algorytm wymaga jedynie prostej modyfikacji funkcji advantage istniejących implementacji RL, co czyni go łatwo integrowalnym z istniejącymi pipelinami. Gradienty TailRL można interpretować jako mieszankę gradientów z metody Best-of-(k), co daje większą wagę rzadkim, ale wartościowym próbkom treningowym. Eksperymenty obejmujące lokalizację obiektów, nawigację w labiryntach, grounding GUI i optymalizację kodu pokazały, że TailRL efektywniej wykorzystuje wysokiego-nagrodowe próbki treningowe i pozwala modelom czerpać większe korzyści z dodatkowych próbek w fazie inferencji.