Badacze zajęli się fundamentalnym problemem przejrzystości modeli uczenia wzmacniającego - polityki rozpowszechniane są najczęściej jako nieprzejrzyste punkty kontrolne sieci neuronowych, bez wyjaśnienia co faktycznie się nauczyły. Zespół opracował protokół umożliwiający reprezentację i komponowanie niezależnie trenowanych polityk poprzez audytowalne reguły behawioralne, definiując auditowralność poprzez sześć oddzielnie testowanych predykatów: integralność ścieżki, kodowanie bez strat, pokrycie reguł, zgodność behawioralną, jakość kompozycji i niezawodność modelu wartości.

Kluczowe odkrycie pracy stanowi rozdzielenie dwóch intuitywnie wydających się spokrewnionych koncepcji. Okazało się, że polícy mogą dzielić identyczne symboliczne reguły decyzyjne, a jednocześnie wybierać akcje prawie całkowicie losowe w nowych stanach. To oznacza, że fuzja reguł nie tworzy nowych umiejętności, ale jedynie wybiera spośród istniejących reguł. Badanie ujawniło również problem niedopasowania między indukcją a wdrożeniem - reguły wyekstrahowane z próbkowanych akcji inaczej zachowywały się pod oceną z akcjami argmaks, a ponowna indukcja zgodna z wdrożeniem odwracała kolejność arbitrażu.

Wyniki wskazują na surowe ograniczenia warstwy opisu dla polityk RL. Test uogólnionej diagnostyki poprawy polityki fitted-Q zawiódł w obu środowiskach, stawiając pod znakiem zapytania twierdzenia, że fuzja reguł jest lepsza od kompozycji opartej na wartościach. Badanie ma znaczenie dla wdrażania przejrzystych systemów RL w praktyce oraz dla zrozumienia limitów obecnych podejść do auditowania skomplikowanych modeli uczenia maszynowego.