Badacze z arXiv zbadali grę o ukrytych regułach (GOHR), gdzie agenty reinforcement learning muszą odkrywać reguły poprzez eksperymentowanie i feedback zwrotny. Focus pracy skupił się na architekturze opartej na Transformerach z algorytmem A2C, testując różne podejścia reprezentacyjne do zrozumienia, jak agenty uczą się abstrakcyjnych koncepcji.

Kluczowym aspektem badania było porównanie dwóch typów reprezentacji: Feature-Centric, gdzie model skupia się na poszczególnych cechach gry, oraz Object-Centric, gdzie agent operuje na poziomie całych obiektów. Naukowcy analizowali także trudność różnych zestawów reguł i jak agenty radzą sobie z transferem wiedzy między zadaniami o różnych poziomach złożoności. To istotne dla zrozumienia, czy modele rzeczywiście uogólniają koncepcje czy tylko zapamiętują konkretne wzorce.

Raport zawiera również nowatorską analizę porównawczą ludzkiego uczenia się wspieranego przez pseudo-boty z nauką sztucznych agentów. Spostrzeżenia z tego badania mogą mieć znaczenie dla projektowania lepszych systemów szkoleniowych i zrozumienia różnic między tym, jak ludzie i maszyny nabywają abstrakcyjne umiejętności, szczególnie w kontekście transfer learning i generalizacji.