Badacze z arXiv odkryli zaskakujące zjawisko: agenty uczenia przez wzmacnianie, które uczy się przy użyciu zamrożonych losowo inicjalizowanych ekstratorów cech CNN, samodzielnie rozwijają niezwykle rzadkie reprezentacje w warstwach pełnokoneksyjnych bez jakiegokolwiek zewnętrznego nacisku na rzadkość. W pierwszej warstwie FC rozmiaru 3136 na 64 neurony, agenty kompresują informacje zadania do zaledwie 1-3 neuronów dla Pong, podczas gdy trenowalne CNN aktywują prawie wszystkie dostępne neurony.

Rzadkość wykazuje wyraźną korelację ze złożonością zadania: od 1-11 neuronów dla Pong, przez 19-26 dla Breakout, aż do około 42 dla Space Invaders. Ciekawe jest również to, że identyczne gry Pong z różnymi ziarnami losowymi produkują agenty z 5, 7 i 11 aktywnymi neuronami. Agent ze wsparciem 5-neuronowym osiąga plateau na wyniku +14, podczas gdy pozostałe osiągają poziom eksperta (+18.4 i +18.7), co sugeruje, że rzeczywista wymiarowość użyteczna losowej projekcji limituje osiągalną wydajność.

Ablacja potwierdza, że te neurony są niezbędne - ich usunięcie powoduje znaczący spadek wydajności. Informacyjne wąskie gardło tworzy się wcześnie w treningu - aktywny zestaw neuronów stabilizuje się między 15 a 30 milionami kroków, podczas gdy nagroda staje się dodatnia dopiero 35-105 milionów kroków później. To odkrycie ma implikacje dla rozumienia tego, jak sieci neuronowe organizują informacje i jak losowe inicjalizacje mogą ograniczać uczenie się.