CODS to nowa procedura wyboru danych opracowana specjalnie dla offline reinforcement learning, gdzie dane są ograniczone i stałe. Problem jest rzeczywisty: gdy wielokrotnie trenuje się różne polityki na tym samym zbiorze transakcji, naiwne zmniejszanie zbioru może prowadzić do utraty rzadkich przejść koniecznych dla nauki długoterminowych strategii. CODS rozwiązuje to poprzez iteracyjny proces - na zmianę dopasowuje krytyka do zbioru i wybiera przejścia o wysokim residuum (błędzie), zanim ostatecznie zamroża reużywalny podzbiór.
W testach na 20 kombinacjach zadań i algorytmów z benchmarku D4RL, CODS przy zaledwie 10 procentach danych oryginalnego zbioru zachowuje 96,6 procent wydajności pełnego modelu. To znacznie lepiej niż konkurencyjne metody ReDOR i OPER - CODS przewyższa je na 19 z 20 testów. Kluczowa różnica od klasycznych podejść to fakt, że wybrany podzbiór jest artefaktem statycznym - można go wielokrotnie stosować do treningu różnych algorytmów bez recyklowania, co stanowi praktyczną zaletę dla badaczy i inżynierów pracujących nad offline RL.
Mechanizm działa poprzez iteracyjne odświeżanie wyników wyboru w miarę jak krytyk się uczy - w przeciwieństwie do selektywnego odtwarzania (prioritized replay), które jest dynamiczne i zmienia się podczas treningu. Badacze sprawdzili również, że pięć rund wyboru daje lepsze wyniki niż jedna runda (11,23 punktu lepiej na reprezentatywnych zadaniach), jednak dodatkowe rundy nie przynoszą już poprawy. Rozszerzenie metody na całe trajektorie zachowuje 95,4 procenta wydajności na zadaniach ALFWorld i 96,5 procenta na GSM8K, co sugeruje uniwersalność podejścia poza czystym offline RL.