Naukowcy zaproponowali SpeedRunner - agenta opartego na modelach kodowania, który analizuje trajektorie poprzednich działań i refaktoryzuje umiejętności dla lepszej wydajności na przyszłych zadaniach. Kluczowa różnica polega na traktowaniu umiejętności jako programów wykonywalnych deterministycznie, zamiast jako podatnych na błędy sekwencji prób i błędów.
Istnieją dwa główne powody, dlaczego to podejście zmniejsza koszty. Po pierwsze, program-augmented agent może niezawodnie osiągać cele bez ryzykownego eksplorowania w długim horyzoncie czasowym. Po drugie, agent uczy się w czasie wnioskowania, stopniowo odkrywając nowe programy i wyposażając się w nie do przyszłych zadań. Naukowcy badali hipotezę, że poprzednie trajektorie zawierają wystarczającą informację do nauki umiejętności, nawet bez mechanizmów replay czy walidacji, o ile agent potrafi je analizować.
W testach na trzech różnych środowiskach fizycznych agent SpeedRunner konsekwentnie osiągnął najlepsze wyniki w uczeniu się i redukcji kosztów, zachowując jednocześnie odporność na zmiany rozkładu danych i losowość środowiska. To sugeruje, że programowe podejście do skill learning może stanowić praktyczne rozwiązanie dla adaptacji agentów do nowych domen przy mniejszych nakładach obliczeniowych.