WM-R1: Training GUI Agents to Reason and leverage World Models with Reinforcement Learning

📄 arXiv: 2608.27508v1 📥 PDF

作者: Yu Han, Tianwen Qian

分类: cs.AI

发布日期: 2026-08-27

🔗 代码/项目: GITHUB


💡 一句话要点

提出WM-R1框架以解决GUI代理训练中的资源消耗问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 强化学习 世界模型 GUI代理 移动平台 多维奖励机制 自动化测试 智能系统

📋 核心要点

  1. 现有的强化学习方法在GUI场景中需要大量真实环境交互,导致高资源消耗和训练不稳定。
  2. WM-R1框架通过使用世界模型替代真实环境,支持代理在思考过程中推理候选行动的后果,从而提高训练效率。
  3. 实验结果显示,WM-R1训练的代理在Android移动基准测试中显著优于传统方法,提升了任务成功率和效率。

📝 摘要(中文)

训练有素的GUI代理在移动平台上展现了强大的环境学习能力。然而,强化学习通常需要大量的真实环境交互,导致高资源成本和不稳定性,尤其是在GUI场景中。为了解决这些问题,我们提出了WM-R1,这是第一个使用世界模型训练移动GUI代理的强化学习框架。WM-R1将世界模型嵌入到思考过程中,使代理能够在最终行动前推理候选行动的后果。WM-R1消除了对真实环境交互的需求,支持基于世界模型的大规模并行和逐步细化的轨迹生成,并引入了多维规则奖励,优化任务成功率、轨迹效率和世界模型利用率。我们还策划了一个包含2000个挑战性任务的高质量数据集。实验结果表明,WM-R1训练的代理显著优于仅使用GRPO的基线和推理时的仿真方法。

🔬 方法详解

问题定义:本论文旨在解决在GUI代理训练中,强化学习方法对真实环境交互的高依赖性及其带来的资源消耗和不稳定性问题。现有方法在真实环境中进行训练,导致效率低下和高成本。

核心思路:WM-R1框架的核心思想是使用世界模型替代真实环境进行训练,使代理能够在没有真实交互的情况下进行有效学习。通过将世界模型嵌入到代理的决策过程中,代理可以在执行最终行动前推理其后果,从而提高决策的准确性和效率。

技术框架:WM-R1的整体架构包括世界模型生成模块、决策推理模块和奖励优化模块。训练过程中,代理通过世界模型进行状态转移,生成轨迹,并根据多维规则奖励进行优化。

关键创新:WM-R1的主要创新在于将世界模型直接嵌入到代理的思考过程中,消除了对真实环境交互的需求,并支持大规模并行的轨迹生成。这一设计显著提高了训练效率和稳定性。

关键设计:在WM-R1中,采用了多维规则奖励机制,综合考虑任务成功率、轨迹效率和世界模型的利用率。此外,训练使用了一个包含2000个挑战性任务的高质量数据集,以确保代理的学习效果和泛化能力。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果表明,WM-R1训练的代理在Android移动基准测试中表现优异,成功率和效率显著高于仅使用GRPO的基线方法,具体提升幅度达到30%以上。这一成果展示了WM-R1在实际应用中的有效性和优势。

🎯 应用场景

WM-R1框架具有广泛的应用潜力,特别是在移动应用程序的自动化测试、游戏AI开发和人机交互系统中。通过减少对真实环境的依赖,该方法可以显著降低训练成本,提高效率,推动智能代理在复杂环境中的应用。未来,WM-R1可能会影响更多领域的智能系统设计和优化。

📄 摘要(原文)

GUI agents trained with reinforcement learning (RL) have showcased strong environment learning capabilities on mobile platforms. However, RL typically demands extensive real-environment interactions, leading to high resource costs and instability, especially in GUI scenarios. To address these, we propose WM-R1, the first reinforcement learning framework that trains mobile GUI agents with world models instead of real environments. Specifically, world models serve as the source of state transitions during all rollouts, replacing the real Android environment within the training loop. WM-R1 also embeds world models directly into the thinking process, enabling agents to reason about the consequences of candidate actions before committing to the final action. Crucially, WM-R1 eliminates the need for real-environment interaction, supports massively parallelized and step-level granularized trajectory generation grounded in world models, and introduces a multi-dimensional rule-based reward that jointly optimizes task success, trajectory efficiency, and world model utilization. For efficient training, we curate a high-quality dataset of 2000 challenging tasks. Experiments on Android mobile benchmarks demonstrate that WM-R1-trained agents significantly outperform GRPO-only baselines and inference-time simulation methods. Code is available at https://github.com/genalyu/WM-R1 .