HarnessWAM: Bridging Prediction and Deliberation in World Action Models
作者: Zhaopeng Gu, Bingke Zhu, Tianxi Lin, Guibo Zhu, Yingying Chen, Kai Wang, Tingyu Yuan, Chaoyang Zhao, Zhaowen Li, Peng Su, Jinqiao Wang
分类: cs.RO
发布日期: 2026-08-10
💡 一句话要点
提出HarnessWAM以解决WAM中的预测与深思之间的差距问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 世界行动模型 具身控制 任务管理 机器人决策 状态维护 故障恢复 复杂任务执行
📋 核心要点
- 现有的世界行动模型在复杂具身任务中存在预测与深思之间的差距,无法满足全局规划和状态维护的需求。
- 本文提出HarnessWAM框架,通过任务管理器和能力条件的可执行空间投影来解决预测-深思差距,实现更高效的任务执行。
- HarnessWAM在RoboMemArena和RoboCerebra Ideal上分别达到了59.6%和23.7%的成功率,显著提升了任务执行的可规划性和可恢复性。
📝 摘要(中文)
世界行动模型(WAMs)共同学习环境动态和机器人动作,将物理演变的先验知识引入具身控制。然而,有限的预测和动作生成不足以应对复杂的具身任务,这些任务需要全局规划、跨阶段状态维护、执行验证和故障恢复。为了解决这一预测-深思差距,本文提出了HarnessWAM,一个基于代理的WAM框架。HarnessWAM利用基于视觉-语言模型的任务管理器维护证据驱动的场景信念和结构化任务图。通过能力条件的可执行空间投影,将开放式语义计划约束为满足任务依赖、具身状态约束和WAM能力边界的原子技能序列。实验结果表明,HarnessWAM在RoboMemArena上实现了59.6%的全任务成功率和69.9%的子任务成功率,在RoboCerebra Ideal上实现了23.7%的成功率,展示了其在具身任务执行中的有效性。
🔬 方法详解
问题定义:本文旨在解决现有世界行动模型(WAMs)在复杂具身任务中面临的预测与深思之间的差距,现有方法在全局规划、状态维护和故障恢复方面存在不足。
核心思路:HarnessWAM框架通过引入基于视觉-语言模型的任务管理器和能力条件的可执行空间投影,旨在将开放式语义计划转化为满足任务依赖和具身状态约束的原子技能序列,从而实现更高效的任务执行。
技术框架:HarnessWAM的整体架构包括任务管理器、能力条件的可执行空间投影和事件驱动的双时间尺度反馈循环。任务管理器维护场景信念和任务状态,反馈循环则通过轻量级进度估计器和任务管理器的协同工作来优化执行过程。
关键创新:HarnessWAM的主要创新在于其模型外的结构化状态维护和闭环代理决策机制,这使得其能够在具身任务执行中实现可规划、可验证和可恢复的能力,与传统WAMs方法相比具有显著优势。
关键设计:在设计中,HarnessWAM采用了基于视觉-语言模型的任务管理器,利用能力条件的可执行空间投影来约束计划,并通过事件驱动的反馈机制实现高频率的执行证据提供,确保任务的顺利推进和故障恢复。
🖼️ 关键图片
📊 实验亮点
HarnessWAM在RoboMemArena上实现了59.6%的全任务成功率和69.9%的子任务成功率,相较于传统方法有显著提升。同时,在RoboCerebra Ideal上也达到了23.7%的成功率,展示了其在复杂任务执行中的有效性。
🎯 应用场景
HarnessWAM的研究成果在机器人自主导航、复杂任务执行和人机交互等领域具有广泛的应用潜力。通过提升机器人在动态环境中的决策能力和执行效率,未来可在智能家居、自动驾驶和服务机器人等实际场景中发挥重要作用。
📄 摘要(原文)
World Action Models (WAMs) jointly learn environmental dynamics and robot actions, introducing priors over physical evolution into embodied control. However, finite-horizon prediction and action generation are insufficient for complex embodied tasks that require global planning, cross-stage state maintenance, execution verification, and failure recovery. We refer to this mismatch as the prediction-deliberation gap of WAMs. To address this gap, we propose HarnessWAM, an agentic framework for WAMs. HarnessWAM employs a vision-language-model-based Task Manager to maintain an evidence-grounded scene belief and a structured task graph. A capability-conditioned executable-space projection further constrains open-ended semantic plans into sequences of atomic skills that satisfy task dependencies, embodiment-state constraints, and the capability boundary of the underlying WAM. During execution, HarnessWAM operates through an event-driven, dual-timescale feedback loop: a lightweight progress estimator continuously provides high-frequency execution evidence, while the Task Manager deliberates at salient milestones by jointly considering the current observation, task state, and interaction history to determine whether to advance the task, acquire additional observations, revise the plan, or initiate local recovery. This mechanism enables the robot to recover its state after a subtask failure and resume execution without discarding previously acquired scene knowledge. HarnessWAM achieves state-of-the-art full-task and subtask success rates of 59.6% and 69.9% on RoboMemArena, and an SR of 23.7% on RoboCerebra Ideal. These results demonstrate that model-external structured state maintenance and closed-loop agentic decision making can effectively extend the local control capabilities of WAMs into embodied task execution that is plannable, verifiable, and recoverable.