Naukowcy zaprezentowali nowy algorytm model-based Reinforcement Learning do syntezy polityk pod zadanymi specyfikacjami Linear Temporal Logic w nieznanych środowiskach. Kluczową innowacją jest połączenie reprezentacji Limit-Deterministic Büchi Automaton specyfikacji LTL z Bayes-Adaptive Markov Decision Process opisującym środowisko, co umożliwia lepszą równowagę między eksploracją a eksploatacją.
Tradycyjne podejścia do RL z ograniczeniami logicznymi często trudnie sobie radzą w warunkach niepewności co do parametrów środowiska. Proponowane rozwiązanie wykorzystuje ramy bayesowskie do modelowania tej niepewności, co pozwala algorytmowi szybciej uczyć się skutecznych strategii. Wprowadzony algorytm Bayes-Adaptive Monte-Carlo Planning stanowi rozszerzenie klasycznych metod BAMCP dostosowane dla zadań z logika temporalną.
Eksperymentalne wyniki pokazują znaczną przewagę pod względem efektywności próbkowania i zdolności do spełniania wymaganych właściwości zadań. Podejście znajduje szczególne zastosowanie w kontekście ostrożnego RL, gdzie celem jest minimalizacja naruszeń warunków bezpieczeństwa już podczas procesu treningu polityki, co jest kluczowe dla praktycznego wdrażania w systemach krytycznych.