Naukowcy opracowali WROP - infrastrukturę danych zawierającą 1,5 miliona próbek treningowych do nauczania modeli generujących wideo zrozumienia trwałości obiektów. Pojęcie to, fundamentalne dla ludzkiego poznania, oznacza, że obiekty istnieją nawet gdy są poza zasięgiem wzroku. Badacze stworzyli 150 ręcznie projektowanych zadań inspirowanych naukami kognitywistycznymi, podzielonych na sześć kategorii, a następnie wykorzystali generatory Blendera do stworzenia ponad 10 tysięcy próbek na zadanie poprzez randomizowanie prędkości, oświetlenia, kąta kamery i innych parametrów.

Team przetestował 14 istniejących modeli wideo - trzy reference-to-video, siedem edycji i cztery kontynuacji - oraz własny model PWM-WROP z 16 miliardami parametrów. W ślepym badaniu porównawczym Elo ich model zajął pierwsze miejsce wśród modeli kontynuacji i trzecie ogólnie, za dwoma modelami reference-to-video. Wyniki sugerują, że modele świata rzeczywiście mogą wyuczyć się podstawowych zasad fizyki poprzez odpowiedni trening.

Wydanie pełnego zestawu danych, egzaminu, odpowiedzi modeli, wyników, wag oraz natywnego stosu treningowego PyTorch na AWS Trainium2 ma znaczące znaczenie dla społeczności AI. Dostęp do tego zasobu pozwala innym badaczom weryfikować wyniki i budować na nich, potencjalnie przyspieszając rozwój modeli świata z lepszym rozumieniem fizyki. To ważny krok w kierunku sztucznej inteligencji z bardziej ludzkimi priorytami poznawczymi.