Naukowcy zaproponowali nowy algorytm RL-NSGA-II-GRC, który łączy reinforcement learning z genetycznym algorytmem optymalizacji wielocelowej NSGA-II wzmocnionym współczynnikami szarej relacji. Metoda została przetestowana na optymalizacji portfela papierów wartościowych z indeksu NASDAQ w celu jednoczesnego zmniejszania ryzyka i maksymalizowania zwrotów.

Algorytm wykorzystuje kontroler RL do online'owego dostosowywania parametrów ewolucyjnych na podstawie hiperobjętości, wykonalności i różnorodności rozwiązań. Operator turniejowy oparty na współczynnikach szarej relacji ranguje rozwiązania poprzez ujednolicony wynik biorący pod uwagę rangę dominacji, dystans zagęszczenia i oddalenie od idealnego punktu odniesienia. W testach porównawczych na benchmarkach Kursawe i CONSTR osiągnął poprawę zbieżności o około 5,8% i 4,4% w stosunku do standardowego NSGA-II, jednocześnie utrzymując dobrze rozłożone rozwiązania niezdominowane.

W praktycznym zastosowaniu do portfela NASDAQ metoda wygenerowała gładką i gęsto zaludnioną frontierę efektywną, umożliwiającą identyfikację portfela z maksymalnym wskaźnikiem Sharpe'a na poziomie 1,92 rocznie oraz portfeli optymalnych dla różnych poziomów awersji do ryzyka. Wynik pokazuje, że kombinacja uczenia ze wzmacnianiem i zaawansowanych operatorów genetycznych może znacznie poprawiać praktyczne problemy optymalizacyjne w finansach.