Naukowcy z arXiv CS.AI wprowadzili ARC-Bench - nowy protokół testowy, który wykazuje fundamentalny problem w modelach JEPA-WM (JEPA World Models) używanych do planowania bez nagród. Te modele zakładają, że można rankować akcje według odległości w zamrożonej przestrzeni latentnej - akcja jest lepsza, jeśli jej przewidywane przyszłe osadzenie (embedding) jest bliższe celowemu osadzeniu. Audyt pokazuje, że założenie to gwałtownie się nie sprawdza: w oficjalnych testach manipulacji najwyżej oceniana akcja jest prawie zawsze suboptymalna, podobnie jak w domenach maze.
Problemy persystują nawet z mocniejszymi encoderami. Badacze testowali zarówno domyślne modele JEPA, jak i wersje z V-JEPA 1 i V-JEPA 2 w skalach ViT-L i ViT-G - wszędzie występuje ten sam problem rankingu. Kontrole dotyczące pochodzenia danych, niedolerencji modeli i kontroli kosztu budżetu wyłączają trywialne wyjaśnienia. Kluczowe odkrycie: defekt pozostawał ukryty dlatego, że ciągłe replanning w pętli zamkniętej maskuje błędy. Gdy naukowcy zmniejszyli częstość replanowania, sukces załamał się zarówno w nawigacji jak i manipulacji, a epizody ratowane przez częste replanning były wzbogacone w poważne błędy rankingu pierwszego planu.
To odkrycie ma znaczące konsekwencje dla całej klasy reward-free world models, które opierają się na tym samym założeniu. Pokazuje, że obecne modele JEPA mogą działać w praktyce tylko dzięki posterunku systemu, a nie dzięki skuteczności podstawowego mechanizmu rankingu akcji. Wyniki sugerują potrzebę fundamentalnego przerewidencji podejścia lub bardziej zaawansowanych metod rankingu akcji w zamrożonych przestrzeniach latentnych.