Badacze zaproponowali fundamentalną zmianę w sposobie treningu agentów opartych na modelach językowych. Zamiast zwijać całą nagrodę z wieloturowej trajektorii do jednej liczby przed aktualizacją polityki, wprowadzili metodę rozkładającą nagrodę na poszczególne podzadania. To rozwiązanie nazwanego RLDS unika straty informacji, jaka występuje w popularnych metodach takich jak GRPO, gdzie optimizer musi domyślnie odgadywać, która konkretna kompetencja wpłynęła na ostateczny wynik.

Serce nowej metody stanowi Subtask-Decomposed Advantage Estimation (SDAE) - zamiennik dla skalarnej przewagi GRPO. SDAE działa na stałej taksonomii podzadań, rozdzielając nagrodę trajektorii na udziały dla każdego z nich, obliczając grupową względną przewagę dla każdego podzadania i dystrybuując kredyt na poziomie tokenów. Ważne jest, że każde podzadanie dostaje wagę względem swojej znaczenia, z skoncentrowaniem kredytu wokół kroków, gdzie model odbicia oznaczył dane podzadanie jako konsekwencyjne. To pozwala sieci neuronowej lepiej zrozumieć, gdzie dokładnie się pomyliła i jak poprawić swojego zachowania.

Badacze testowali RLDS na czterech wymagających benchmarkach agentycznych: FrozenLake (rzadka nawigacja sieciowa), HotpotQA (wieloskokowe pytania przy jednym narzędziu do wyszukiwania), ScienceWorld (długohoryzontalny embodied learning nauki) i DeepResearch (długoformowe badania z czterema narzędziami i złożoną nagrodą rubryką). Diagnostyka heterogeniczności wydawana podczas treningu pokazuje, gdzie dekompozycja przyczynia się do sukcesu, a zyski skalują się w zależności od złożoności zadania. To podejście jest szczególnie ważne dla rzadkich i opóźnionych sygnałów zwrotnych, gdzie tradycyjne metody polegające na agregacji drastycznie tracą na wydajności.