Naukowcy opracowali Keyframe Mnemonics, innowacyjną metodę samozadaną do odkrywania zbioru obserwacji krytycznych dla zachowań agentów w środowiskach niemarkowskich, gdzie decyzje zależą od długoterminowego kontekstu. Metoda uczy się celu na podstawie losowo próbkowanych poprzednich obserwacji i wykorzystuje go jako nagrodę do wyboru kluczowych klatek, a następnie trenuje politykę klonowania zachowań opartą na odkrytych klatkach.

Istniejące podejścia do problemu opierają się na sieciach rekurencyjnych lub mechanizmach attention, ale oba mają poważne ograniczenia. Modele rekurencyjne cierpią na upadek stanu ukrytego i niestabilność gradientów podczas backpropagacji przez czas, zaś modele oparte na attention są fundamentalnie ograniczone długością kontekstu, którą mogą przetwarzać. Keyframe Mnemonics rozwiązuje te problemy poprzez selektywne przechowywanie tylko najważniejszych informacji w pamięci roboczej polityki, co gwarantuje retencję kontekstu nad nieskończonym horyzontem przy zachowaniu małego zbioru decyzyjnie istotnych klatek.

Wyniki eksperymentów są imponujące: w syntetycznych domenach pamięciowych polityki warunkowane mnemonics osiągały 100% wskaźnik sukcesu i generalizowały się do horyzontów o rzędy wielkości dłuższych niż dane treningowe bez degradacji wydajności. Na bardziej złożonych benchmarkach manipulacji robotycznej metoda wykazała średnią bezwzględną poprawę o 13,9% w stosunku do najsilniejszych dotychczasowych rozwiązań, co sugeruje praktyczne zastosowanie w rzeczywistych zadaniach wymagających długoterminowego planowania.