Naukowcy z arXiv zaprezentowali WebGrader, nowe podejście do szkolenia modeli LLM w tworzeniu kompletnych witryn internetowych na podstawie naturalnych opisów. System rozwiązuje problem projektowania nagród dla reinforcement learning poprzez autonomiczne wyprowadzanie wymaganych przepływów interakcji z każdego żądania strony, reprezentowanie ich jako wykonywalnych Flow Contract i wykorzystywanie wyników wykonania jako nagrody dla RL.

Główna innowacja WebGrader polega na separacji czterech kluczowych etapów: planowania testów, ugruntowania akcji w kodzie źródłowym i živym DOM, zbierania dowodów wizualnych i stanowych na tej samej trajektorii przeglądarki oraz semantycznych ocen. System materializuje wygenerowany projekt w działającej przeglądarce, co pozwala mu obserwować faktyczne przejścia i wydawać pozytywny werdykt dopiero po zaobserwowaniu żądanej zmiany. Pętla offline oparta na pozostałościach odkrywa ponownie użyteczne umiejętności weryfikacji, testuje je na oddzielnych stronach walidacyjnych i zamraża promowany graf umiejętności przed treningiem polityki.

Wyniki na benchmarku WebGen-Bench pokazują, że WebGrader trenuje model 8-miliardowy do 52,01 procent funkcjonalnego sukcesu, przewyższając dopasowaną nagrodę wygląd-plus-skrypt o 7,88 punktu i osiągając wyniki lepsze niż o4-mini i DeepSeek-v4. To podejście stanowi znaczący krok naprzód w automatyzacji tworzenia aplikacji webowych i potencjalnie może transformować sposób, w jaki LLM są szkolone do wykonywania złożonych, wieloetapowych zadań programistycznych.