Naukowcy zaproponowali LUCID - hierarchiczny model do planowania działań humanoidalnych robotów w długich sekwencjach zadań, gdzie robot musi zarówno się poruszać, jak i manipulować przedmiotami. Problem, który rozwiązuje, dotyczy ograniczeń istniejących podejść opartych na ręcznie napisanych planach lub gotowych umiejętnościach - takie systemy słabo radzą sobie z bardziej złożonymi sekwencjami działań.

LUCID działa na dwóch poziomach. Najpierw uczy się niskopoziomowej polityki sterowania poprzez naśladownictwo konkurencyjne (adversarial imitation), aż ta umiejętność zostanie zamrożona. Następnie równolegle trenuje wysokopoziomową politykę decyzyjną i model dynamiki świata, który przewiduje, jak robot przejdzie z jednego stanu do drugiego na podstawie abstrakcyjnych decyzji. To pozwala robotowi planować poprzez wyobrażone scenariusze - testuje w głowie, co się stanie, zanim faktycznie zrobi ruch.

Badacze testowali system w symulacjach ze scenariuszami przearanżowania wielu przedmiotów. LUCID osiągnął wyższe współczynniki pełnego sukcesu i częściowego ukończenia zadań w porównaniu z innymi metodami. To podejście łączy zalety uczenia przez naśladownictwo z mocą modelowania dynamiki, co powinno przybliżyć nas do robotów zdolnych do bardziej samodzielnego radzenia sobie w złożonych sytuacjach.