Zespół naukowców zaproponował metodę RLPF - reinforcement learning from performance feedback - która uczy modele kodowania optymalizować nie tylko poprawność, ale również wydajność wykonania. Problem stanowi fakt, że runtime jest kruchy jako sygnał treningowy - ma znaczenie tylko gdy program jest poprawny, zmienia się między zadaniami i daje mało wskazówek, gdy większość próbkowanych programów nie kompiluje się lub nie uruchamia.
Key innowacją RLPF jest pięciostopniowa funkcja nagrody. Dla programów błędnych system przydziela nagrody na podstawie postępu wykonania - program, który przetworzył więcej linii kodu lub dotarł dalej w wykonywaniu, otrzymuje wyższą nagrodę niż całkowicie niefunkcyjny kod. Dla programów poprawnych ranking odbywa się przez porównanie względnej poprawy wydajności względem baseline'u w stosunku do eksperta referencyjnego. Takie podejście zapewnia pożyteczny feedback już na etapie przed uzyskaniem poprawności, a potem dostarcza feedback wrażliwy na wydajność.
Rezultaty są znaczące. Fine-tuning modelu Qwen3-32B z RLPF na zbiorze danych PerfCodeBench podniósł odsetek poprawnych i działających rozwiązań z 11,1% do 54,6%, a względną wydajność z 8,1% do 38,6%. Wytrenowany model stał się konkurencyjny w stosunku do silniejszych systemów o otwartych wagach. Badania dodatkowe wykazały, że referencje generowane przez model zapewniają przydatny, choć słabszy nadzór, a pełna złożona nagroda jest bardziej wiarygodna niż sama poprawność lub samo uruchamianie.