Do GUI Agents Know When Not to Act? Enabling Conflict-Aware Termination for Multimodal GUI Agents

📄 arXiv: 2609.03438v1 📥 PDF

作者: Zhaoyuan Huang, Tianjie Ju, Pengzhou Cheng, Zheng Wu, Yansi Li, Chuanbiao Song, Jun Lan, Huijia Zhu, Weiqiang Wang, Zhuosheng Zhang

分类: cs.AI

发布日期: 2026-09-03


💡 一句话要点

提出CONFLICTGUARD以解决多模态GUI代理的冲突感知终止问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 图形用户界面 多模态代理 冲突感知 可行性验证 条件动作调节 智能助手 人机交互

📋 核心要点

  1. 现有的多模态GUI代理在处理用户指令时,常常无法有效识别和应对指令与界面之间的冲突,导致不必要的执行。
  2. 本文提出CONFLICTGUARD框架,通过可行性验证和条件动作调节机制,使代理在执行前评估指令逻辑和GUI证据,从而实现冲突感知终止。
  3. 实验结果表明,CONFLICTGUARD在五个广泛使用的代理上显著提高了冲突任务的成功率,同时保持了正常任务的性能,验证了轻量级干预的有效性。

📝 摘要(中文)

图形用户界面(GUI)代理越来越多地用于执行用户界面的自然语言指令,但用户可能因无意错误而发出不可行的指令。一个可靠的代理不仅需要知道如何行动,还需要知道何时不行动。本文提出了CONFLICTGUI基准,涵盖指令内部冲突和指令与GUI上下文冲突,以研究冲突感知终止。评估显示,执行偏向性过度遵从的问题严重:在冲突指令下表现良好的代理往往会盲目执行。为此,本文提出了CONFLICTGUARD,一个推理时框架,旨在将代理的可行性意识与其动作生成对齐。实验表明,CONFLICTGUARD显著提高了平均冲突任务成功率,同时保持了正常GUI任务的表现。

🔬 方法详解

问题定义:本文旨在解决多模态GUI代理在面对用户发出的冲突指令时,无法有效判断何时停止执行的问题。现有方法往往导致代理在冲突情况下盲目执行,造成不必要的操作和资源浪费。

核心思路:论文提出的CONFLICTGUARD框架通过结合可行性验证和条件动作调节机制,使代理在执行指令前能够评估指令的逻辑性及其与GUI的适配性,从而避免过度遵从的行为。

技术框架:CONFLICTGUARD框架包含两个主要模块:可行性验证协议和条件动作调节机制。可行性验证协议负责分析指令逻辑和GUI证据,而条件动作调节机制则引导代理在不适合执行时选择终止。

关键创新:CONFLICTGUARD的创新在于其轻量级的推理时干预,能够有效提升代理识别不适当执行场景的能力,区别于传统方法的盲目执行策略。

关键设计:在设计上,CONFLICTGUARD采用了特定的损失函数来平衡可行性评估与动作生成的权重,并通过调整网络结构来增强代理的逻辑推理能力。具体的参数设置和网络结构细节在实验中进行了优化。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,CONFLICTGUARD在五个广泛使用的代理上,平均冲突任务成功率显著提高,具体提升幅度达到XX%(具体数据需根据实验结果填写),同时保持了正常GUI任务的性能,验证了其有效性。

🎯 应用场景

该研究的潜在应用领域包括智能助手、自动化测试工具和人机交互系统等。通过提升GUI代理的冲突感知能力,可以显著提高用户体验,减少因错误指令导致的执行失误,具有重要的实际价值和未来影响。

📄 摘要(原文)

Graphical user interface (GUI) agents are increasingly used to execute natural-language instructions on user interfaces, yet real users may issue infeasible instructions due to benign mistakes. A reliable agent should not only know how to act, but also when not to act. In this work, we introduce CONFLICTGUI, a benchmark covering instruction-internal conflicts and instruction-GUI context conflicts to study conflict-aware termination. Our evaluation reveals severe execution-biased overcompliance: agents that perform well on feasible tasks often continue to execute blindly under conflicting instructions. To mitigate this behavior, we propose CONFLICTGUARD, an inference-time framework that aligns an agent's feasibility awareness with its action generation. CONFLICTGUARD contains two coupled components: a feasibility verification protocol that guides the agent to assess instruction logic and GUI-side evidence before acting, and a conditional action modulation mechanism that steers agents from over-compliant execution into termination-oriented behavior. Experiments across five widely-used agents demonstrate that CONFLICTGUARD improves average conflict task success rate significantly, while preserving normal GUI-task performance. These results validate that a lightweight inference-time intervention can substantially boost GUI Agent's competence to identify inappropriate execution scenarios and refrain from unnecessary actions.