Naukowcy z arXiv zaproponowali MCC-PGPSE - ulepszenie algorytmu PGPSE, który trenuje wiele niezależnych polityk równolegle w celu maksymalizacji eksploracji stanów w środowisku. Problem oryginalnego podejścia polega na tym, że miara zbiorowej entropii zespołu nie pokazuje, które konkretne polityki rzeczywiście przyczyniają się do odkrywania nowych stanów, a które po prostu redundantnie odwiedzają już znane obszary.

Nowa metoda wprowadza tak zwaną marginalną kredytowość pokrycia, którą oblicza się stosując technikę leave-one-policy-out - sprawdzając, jak bardzo pogarsza się eksploracja bez każdej z polityk. Dodatkowo uwzględnia specjalizację agentów w różnych stanach. Na tej podstawie algorytm przydziela wewnętrzne nagrody motywacyjne w sposób, który zniechęca zbędne wizyty i promuje komplementarną eksplorację środowiska.

Wyniki testów przeprowadzonych na siedmiu publicznych benchmarkach dyskretnych, a także w kontrolowanych środowiskach Room i Maze pokazują, że MCC-PGPSE konsekwentnie poprawia zarówno znormalizowaną entropię stanów zespołu, jak i liczbę faktycznie odwiedzonych stanów. Ablacyjne testy ujawniły, że większość zysków pochodzi z samego mechanizmu leave-one-policy-out niż z niejednorodnego ważenia nagród czy dodatkowych efektów.