Naukowcy opracowali metodę łączenia wiedzy symbolicznej z reinforcement learningiem, aby agenci robocze mogli bezpiecznie reutilizować znane wzorce zachowań zamiast uczyć się wszystkiego od nowa. Problem pojawia się, gdy symbolicna wiedza zostanie źle zintegrowana z polityką uczącą się - może to prowadzić do tzw. halucynacyjnych warunków wstępnych, gdzie agent podejmuje akcje w niewłaściwych sytuacjach, co stanowi zagrożenie dla bezpieczeństwa w dynamicznych środowiskach.

Autorzy sformalizowali tę wiedzę behawioralną jako sieć bayesowską warunków wstępnych działającą na strukturalne akcje agenta - takie jak podniesienie klucza, chwycenie bloku, otwarcie drzwi czy upuszczenie obiektu. Sieć ogranicza, kiedy te akcje mogą być wykonane. Zaproponowali trzy sposoby wstrzyknięcia tej wiedzy do procesu uczenia: weryfikator symboliczny (konsultowany tylko podczas wnioskowania), egzekutor symboliczny (aktywny zarówno podczas treningu jak i wnioskowania) oraz symboliczny uczący się (integrujący wiedzę bezpośrednio w architekturę sieci neuronowej).

Badanie testuje wszystkie trzy warianty na dwóch zbiorach benchmarkowych z przeciwstawnymi reżimami operacyjnymi. To podejście ma znaczenie dla prakytcznych zastosowań robotyki i systemów autonomicznych, gdzie błędy w podejmowaniu decyzji mogą mieć poważne konsekwencje. Metoda pozwala agentom na inteligentne ponowne użycie wcześniej zdobytej wiedzy, zamiast od nowa trenować dla każdego nowego zadania.