Badacze z arXiv odkryli potencjalny problem w cache'owaniu wyników narzędzi stosowanym w treningu agentów - mimo że buforowane wyniki marginalnie zgadzają się z rozkładem nagród, mogą one odwrócić kierunek aktualizacji polityki dla całych grup agentów. Problem pojawia się, gdy jeden wynik stochastyczny jest dzielony między grupę niezależnie trenowanych agentów.
W badanym modelu dwuakcyjnym naukowcy wykazali matematycznie, że wspólne cache'owanie wyników prowadzi do innego wariantu aktualizacji polityki niż niezależne wykonanie. Zamiast opierać się na różnicy oczekiwanych nagród, aktualizacja śledzi prawdopodobieństwo wygranej minus prawdopodobieństwo przegranej. Dla rozkładu Bernoulliego efekt jest jeszcze bardziej wyraźny - pojawia się obszar, gdzie aktualizacja idzie w całkowicie złym kierunku, a wariancja nie zmniejsza się wraz ze wzrostem wielkości grupy.
Badacze przetestowali 540 różnych konfiguracji i 3240 ocen estymatorów, a także przeprowadzili audyt implementacyjny na rzeczywistym stosie TVCache z 256 skryptowanymi rolloutami. Wyniki sugerują, że sama marginalnej poprawności wyniku nie można traktować jako gwarancji treningowej równoważności cache'u. Jednym z potencjalnych rozwiązań jest normalizacja bez skalowania przez odchylenie standardowe grupy, która zachowuje kierunek aktualizacji oczekiwanego zwrotu.