Naukowcy przedstawili GUI-CC, benchmark specjalnie zaprojektowany do oceny modeli świata GUI w roli środowisk dla agentów AI, zamiast jedynie jako predyktorów pojedynczych ekranów. Dotychczas tego typu modele były testowane głównie na ich zdolności do generowania następnego ekranu w izolacji, co nie odzwierciedla rzeczywistego scenariusza użycia - gdzie wygenerowane stany muszą pozostać spójne podczas wieloetapowych interakcji agenta.

Benchmark składa się z dwóch ścieżek: track offline, który uruchamia modele na rzeczywistych trajektoriach z aplikacji mobilnych (500 zadań z GUIOdyssey), oraz track online z agentami testującymi interfejsy generowane przez modele (200 zadań zweryfikowanych w emulatorze, obejmujących 30 aplikacji). GUI-CC mierzy cztery kluczowe aspekty: wierność przejść między ekranami, ich wiarygodność, konsystencję kontekstową oraz postęp w realizacji zadań użytkownika.

Wyniki eksperymentów ujawniają znaczący problem: modele potrafiące wygenerować pojedynczy ekran wyglądający na prawidłowy nie gwarantują niezawodnej symulacji środowiska. Badania pokazują, że obecne modele często tworzą ekrany, które wydają się użyteczne, ale jednocześnie tracą kontekst istotny dla zadania lub nie wspierają wykonywalnych wieloetapowych sekwencji akcji. To odkrycie podkreśla potrzebę przesunięcia fokus z oceny zdolności generatywnych na rzecz testowania rzeczywistej przydatności modeli jako interaktywnych środowisk dla autonomicznych agentów.