NVIDIA zespół NeMo zaprezentował Molt, zoptymalizowany framework do agentic reinforcement learning, który drastycznie zmniejsza złożoność badań nad RL poprzez radykalną redukcję rozmiaru codebase'u. Zamiast typowego dla industry'ego podejścia wymagającego modyfikacji wielowarstwowych systemów treningowych, Molt zawiera około 8,6K linii kodu RL - znacznie mniej niż konkurencyjne rozwiązania jak verl z 62K linii czy OpenRLHF z 7,2K linii kodu.

Projekt NVIDII ma dwa kluczowe cele: po pierwsze, codebase powinien być wystarczająco kompaktowy, aby badacz mógł zrozumieć go w całości bez patrzenia na dokumentację, a po drugie, powinien być czytelny dla AI coding assistantów, które mogą całkowicie przeanalizować kod. To podejście drastycznie przyspiesza iterację nad nowymi estymatorami, pipelinami rollout i schematami trenowania, co jest sercem badań nad agentic RL.

Molt dostępny jest na licencji Apache 2.0 wraz z gotowymi skryptami uruchamiającymi, skryptami Slurma i prebudowanym kontenerem. Jednak rzeczywistą barierą wejścia są zasoby sprzętowe - domyślne przepisy zakładają dostęp do 16 procesorów GPU H100 rozłożonych na 2 węzłach dla treningu i rollout'u. To ogranicza adopcję do najbogatszych ośrodków badawczych, dobrze finansowanych startupów zajmujących się post-trainingiem modeli, zespołów research'owych w przedsiębiorstwach (finanse, healthcare, robotyka) oraz instytucji akademickich z wielowęzłowym dostępem do H100 lub H200. Framework znajduje zastosowanie w scenariuszach wymagających multi-turn tool-use agents, agentów zdolnych do wykonywania kodu oraz aplikacjach vision-language.