Naukowcy z arXiv zaprezentowali AutoWorldModel-Bench, nowy benchmark mający oceniać zdolności autonomicznych agentów kodujących w dziedzinie modelowania świata. W przeciwieństwie do większości obecnych benchmarków skupiających się na projektowaniu według specyfikacji, AutoWorldModel-Bench stawiając agentom zadanie otwarte - ulepszanie modelów świata pod stałym budżetem obliczeniowym bez wcześniej określonego kierunku ulepszeń.

Benchmark składa się z ośmiu środowisk gier, w których wszystkie modele operują na ujednoliconej reprezentacji stanów - ekstrakcji informacji o bytach bezpośrednio z gier, przesyłanej w formacie tensorowym. Takie podejście odizolowuje modelowanie dynamiki od percepcji wizualnej i umożliwia szybkie iteracje kodu - każda sesja trwa zaledwie kilka minut. Testy wykazały, że zarówno Codex-5.4 jak i Claude Opus 4.6 potrafiły ulepszać kod startowy w 63 na 64 sesjach. Co istotne, w 91 procentach udanych sesji wygrane edycje były poważnymi modyfikacjami o charakterze badawczym - nowe funkcje celu, zmienione reprezentacje, nowe procedury rolloutów lub zmiany architektoniczne - zamiast zwyczajnym dostrojeniem hiperparametrów.

Wyniki sugerują, że tego typu benchmark może stać się wartościowym narzędziem do ewaluacji agentów AI nie tylko w inżynierskich zadaniach o jasnych specyfikacjach, ale także w otwartych, badawczych problemach wymagających kreatywności i głębokich zmian w podejściu. Pole modelowania świata jest nadal niestabilne, bez jednego dominującego rozwiązania, co czyni je idealnym polem testowym dla autonomicznych badaczy opartych na AI.