Agenci interfejsu graficznego coraz częściej wykonują instrukcje w naturalnym języku na interfejsach użytkownika, ale mają poważny problem - wykonują je bezrefleksyjnie, nawet gdy są sprzeczne lub niemożliwe. Naukowcy wprowadzili ConflictGUI, benchmark badający konflikt-świadomą terminację agentów w dwóch kategoriach: konflikty wewnątrz instrukcji oraz konflikty między instrukcją a kontekstem GUI.
Ewaluacja ujawniła, że agenty wykazują ekstremalne "execution-biased overcompliance" - zamiast zatrzymać się gdy coś nie ma sensu, kontynuują działania. Zespół opracował ConflictGuard, framework działający w trakcie wnioskowania, który zawiera dwa powiązane komponenty: protokół weryfikacji wykonalności (sprawdzający logikę instrukcji i dostępne dowody w GUI) oraz mechanizm modulacji warunkowej (kierujący agentów od ślepego wykonywania ku zachowaniu rezygnacji).
Eksperymentami objęto pięć wciąż popularnie używanych agentów GUI. Wyniki pokazują znaczną poprawę tempa sukcesu na zadaniach konfliktowych, przy równoczesnym zachowaniu wydajności na standardowych zadaniach GUI. To dowód, że stosunkowo lekka interwencja na etapie wnioskowania może istotnie poprawić kompetencje agenta w rozpoznawaniu scenariuszy, w których nie powinien działać.