UI-Venus-2 to nowy agent oparty na fundacyjnym modelu multimodalnym, zaprojektowany do obsługi zautomatyzowanych zadań w interfejsach użytkownika na trzech platformach: urządzeniach mobilnych, aplikacjach internetowych i systemach stacjonarnych. Poprzednie podejścia bazowały głównie na benchmarkach, ale realizacja rzeczywistych problemów natykała się na niedostateczne pokrycie środowisk, niestabilne konstrukcje zadań i zawodne systemy weryfikacji.

Zespół rozwiązał te wyzwania poprzez skalowanie trzech kluczowych wymiarów. Po pierwsze, rozszerzył środowiska testowe do ponad 170 wielojęzycznych aplikacji mobilnych oraz natywnych systemów operacyjnych. Po drugie, wykorzystał zaawansowany pipeline badawczy do generacji instrukcji powiązanych z funkcjonalnością systemu. Po trzecie, wdrożył dwupoziomową weryfikację: na poziomie śladów wykonania oraz próbek, ze wskaźnikami wizualnymi i głosowaniem wielu modeli, co zapewnia bardziej wiarygodne sygnały do trenowania modelu poprzez reinforcement learning.

Osobna innowacja to integracja mechanizmów uwzględniających bezpieczeństwo, pozwalająca na kontrolowaną realizację akcji o znaczących konsekwencjach. Projekt został udostępniony jako open-source, co powinno przyspieszyć rozwój bardziej uogólnionych, weryfikowalnych i zdolnych do samooceny agentów do praktycznych aplikacji w świecie rzeczywistym.