Badacze przedstawili SPOT - innowacyjny framework do zrozumienia, jak podejmują decyzje zaawansowane agenty uczenia się ze wzmacnianiem działające w złożonych środowiskach. Zamiast patrować na pojedyncze kroki decyzyjne, SPOT konstruuje drzewo możliwych przyszłych trajektorii poprzez próbkowanie działań i symulowanie ich konsekwencji, zapewniając kompletniejszy obraz preferencji polityki agenta.

Metoda jest uniwersalna - nie wymaga wiedzy o wewnętrznej strukturze modelu i pracuje z dowolnym dostępnym środowiskiem symulacyjnym. SPOT ma też formalne gwarancje matematyczne: potrafi asymptotycznie odtworzyć najczęstsze działanie preferowane przez politykę oraz charakteryzować jej zachowanie w przypadku polityk o wysokiej entropii. To ważne dla weryfikacji bezpieczeństwa autonomicznych systemów decyzyjnych.

W demonstracji na platformie SUMO-RL zajmującej się sterowaniem sygnalizacją świetlną framework wykazał zdolność do głębszej analizy niż dotychczasowe metody oparte na atrybuacji pojedynczych cech. Reprezentacja drzewiasta pozwala inspektować preferencje polityki, porównywać alternatywne przyszłe scenariusze i odkrywać zachowania systemu, które pozostają ukryte dla analiz skoncentrowanych na jednym kroku czasowym. To kluczowe dla bezpieczeństwa i ufności wobec systemów autonomicznych w krytycznych aplikacjach.