Microsoft Research zaprezentował Webwright - framework agenta sieciowego, który niemal podwoił wydajność GPT-4 w wykonywaniu zadań webowych. Na benchmarku Odyssey nowy system osiągnął wynik 60,1%, podczas gdy bazowy GPT-4 radził sobie zaledwie na poziomie 33,5%. To spora różnica, która pokazuje, jak wiele można zyskać na wymyślnym podejściu do automatyzacji interakcji z interfejsami internetowymi. Webwright działa w terminalu i potrafi autonomicznie poruszać się po stronach, klikać elementy, wypełniać formularze oraz wykonywać bardziej skomplikowane sekwencje działań - wszystko bez bezpośredniej interwencji człowieka.

Innowacja ta stanowi przełom w kwestii zdolności AI do pracy z aplikacjami webowymi. Dotychczasowe agenty часто zatracały się w labiryncie dynamicznych interfejsów, miały problemy z lokalizacją elementów lub zrozumieniem kontekstu. Webwright rozwiązuje wiele z tych problemów dzięki mądrzejszej strategii eksploracji i lepszemu modelowaniu struktury stron. To otwiera drzwi do automatyzacji tysięcy rutynowych procesów - od wypełniania wniosków, przez wyszukiwanie informacji, aż po transakcje handlowe czy rezerwacje.

Wyniki na Odyssey pokazują, że agenty sieciowe wkraczają w fazę praktycznego zastosowania. Jeszcze kilka lat temu takie osiągi byłyby niemożliwe. Teraz przed branżą stoi pytanie, czy taka automatyzacja znajdzie szerokie zastosowanie w biznesie i jak długo zanim podobne rozwiązania trafią do głównych produktów technologicznych. Microsoft szybko iteruje swoje narzędzia AI, więc można się spodziewać, że Webwright lub jego descendenci pojawią się w praktycznych aplikacjach dość szybko.