Wdrażanie reinforcement learning w rzeczywistych systemach stoi przed fundamentalnym wyzwaniem: wyborem odpowiednich hiperparametrów bez dostępu do symulatora i możliwości kosztownych testów online. Naukowcy zaproponowali rozwiązanie w postaci modeli kalibracyjnych trenowanych na danych offline, które przybliżają dynamikę środowiska. Po raz pierwszy przetestowali to podejście w przemysłowej aplikacji - miejskiej oczyszczalni wody, wykorzystując k-nearest neighbors z metryką Laplacian distance do analizy wysokowymiarowych, niestacjonarnych danych sensorycznych.
Wyniki pokazują, że kalibracyjne modele dynamiki potrafią generować realistyczne długohoryzontalowe symulacje i odtwarzać znaczące trendy wrażliwości hiperparametrów. Badania objęły też skalowanie na roczne zbiory danych oraz wsparcie dla wyboru learning rate'ów fine-tuningu dla wstępnie wytrenowanych agentów. Zespół zbadał również odporność modeli na distribution shift - zmianę charakterystyki danych w czasie.
To pierwszy praktyczny dowód koncepcji użycia offline modeli dynamiki do wspierania wdrożeń RL w rzeczywistych środowiskach. Praca jednocześnie podkreśla ważne wyzwania praktyczne, takie jak obsługa niestacjonarnych danych sensorycznych i długoterminowa stabilność prognoz, które będą wymagały dalszych badań przed szerokim zastosowaniem tej metody.