Naukowcy z arXiv CS.AI zaprezentowali metodę konwersji wytrenowanej polityki deep reinforcement learning (PPO) na wykonywalny program Prolog, który stanowi czytelną i modyfikowalną reprezentację decyzji sieci neuronowej. Proces obejmuje trzy etapy: ekstrakcję zamrożonej polityki nauczyciela, indukcję uporządkowanej listy reguł wzorem klasycznego uczenia relacyjnego oraz emisję wyniku jako programu Prolog, którego każda decyzja jest wykonywana przez silnik logiczny.

Metoda oferuje cztery kluczowe gwarancje matematyczne. Ograniczenie straty zwrotu sprawia, że destylowany program stanowi weryfikowalny certyfikat dla skończonego procesu decyzyjnego Markowa. Etap ekspansji reguł ulepszony jest pętlą optymalizacyjną, która akceptuje zmiany tylko jeśli ewaluacja polityki potwierdzi wzrost zwrotu. W ustawieniu ciągłych obserwacji proporcjonalne instancjonowanie progu konwertuje sieć z dowolną dokładnością - rozbieżność wynosi O(1/B), gdzie B to rozdzielczość. Dolne ograniczenie pokazuje jednak, że koszt rośnie wykładniczo wraz z wymiarem obserwacji dla ukośnych granic decyzyjnych.

Emperycznie na zadaniu otwierania drzwi w dwóch pokojach z 16 944 osiągalnymi stanami rozszerzony program Prolog osiąga dokładnie optymalny zwrot dla każdego zarejestrowania. Podejście otwiera nową perspektywę: tradycyjne systemy eksperckie mogą być przeładzane przy użyciu współczesnego deep learningU, a następnie ponownie konwertowane na przejrzysty kod, który można audytować, modyfikować i wdrażać bez czarnych skrzynek.