DECOWAM: Decoupled Whole-Body World-Action Model for Legged Mobile Manipulation

📄 arXiv: 2608.20114v1 📥 PDF

作者: Siyuan Ma, Boshi Zhang, Yutian Zhang, Qinglian Wu, Jiaqi Zhai, Dong Wei, Qiaojun Yu

分类: cs.AI, cs.RO

发布日期: 2026-08-20

备注: 8 pages, 5 figures. Introduces DECOWAM, a decoupled whole-body world-action model for legged mobile manipulation, and the ARMDOG real-robot dataset


💡 一句话要点

提出DECOWAM以解决移动操控中的视觉预测问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control)

关键词: 移动操控 视觉预测 世界-动作模型 全身控制 机器人学习 因子分解 动态环境 多模态融合

📋 核心要点

  1. 现有的世界-动作模型未能有效区分相机自运动与基座和手臂动作,限制了移动操控的性能。
  2. DECOWAM通过专用条件接口分离相机自运动与基座和手臂动作,提升了视频预测和动作预测的准确性。
  3. 实验结果显示,DECOWAM在动作均方误差上降低了21.7%,并在闭环试验中展现出最佳的全身协调性和鲁棒性。

📝 摘要(中文)

移动操控要求机器人预测运动和手臂动作如何共同影响未来观察和控制。现有的世界-动作模型主要针对固定基座平台,未能明确区分相机自运动与基座和手臂动作。本文提出DECOWAM,一个整体的世界-动作模型,通过专用的条件接口分离这些因素。DECOWAM冻结了改进的FastWAM骨干网络,并训练残差适配器,提取出从特权观察中蒸馏的动作等效未来瓶颈,利用对抗性分离的基座和手臂潜变量,以及基座速度条件进行视频预测。此外,本文引入了ARMDOG,一个同步视频、全身状态和动作及语言的真实机器人数据集。在固定重放协议下,DECOWAM在未来视频和动作预测上均优于FastWAM,动作均方误差降低了21.7%。在79个闭环试验中,其整体协调性和基座位移鲁棒性均优于其他对比系统,同时任务完成度与最强基线相当。这些结果表明,具身意识的因子分解能够支持在移动视点下的参数高效的联合视觉预测和全身控制。

🔬 方法详解

问题定义:本文旨在解决移动操控中机器人如何有效预测运动和手臂动作对未来观察和控制的影响。现有方法未能明确区分相机自运动与基座和手臂动作,导致预测性能不足。

核心思路:DECOWAM通过引入专用的条件接口,将相机自运动与基座和手臂动作分离,从而提高了模型的预测能力和控制精度。该设计使得模型能够更好地理解和处理动态环境中的视觉信息。

技术框架:DECOWAM的整体架构基于改进的FastWAM骨干网络,冻结其参数并训练残差适配器。模型通过对抗性分离的基座和手臂潜变量,以及基座速度条件,进行未来视频和动作的预测。

关键创新:DECOWAM的主要创新在于其具身意识的因子分解方法,能够有效支持参数高效的联合视觉预测和全身控制。这一方法与现有模型的本质区别在于其明确的动作分离机制。

关键设计:在模型设计中,使用了残差适配器来提取动作等效未来瓶颈,并采用对抗性训练来分离基座和手臂潜变量。此外,基座速度条件的引入进一步增强了视频预测的准确性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

DECOWAM在固定重放协议下的实验结果显示,其在未来视频和动作预测方面均优于FastWAM,动作均方误差降低了21.7%。在79个闭环试验中,DECOWAM展现出最佳的全身协调性和基座位移鲁棒性,同时任务完成度与最强基线相当,体现了其优越的性能。

🎯 应用场景

该研究的潜在应用领域包括服务机器人、自动驾驶和人机协作等场景。通过提高机器人在动态环境中的视觉预测能力,DECOWAM能够更好地完成复杂的操作任务,提升机器人在实际应用中的效率和安全性。未来,该模型可能推动更智能的机器人系统的发展,促进人机协作的进一步深化。

📄 摘要(原文)

Mobile manipulation requires a robot to predict how locomotion and arm motion jointly alter future observations and control. Existing world-action models, developed largely for fixed-base platforms, do not explicitly distinguish camera ego-motion from base and arm actions. Here we introduce DECOWAM, a whole-body world-action model that separates these factors through dedicated conditional interfaces. DECOWAM freezes an adapted FastWAM backbone and trains residual adapters, an action-equivalent future bottleneck distilled from privileged observations, adversarially separated base and arm latents, and base-velocity conditioning for video prediction. We further introduce ARMDOG, a real-robot dataset that synchronizes video, whole-body state and action, and language. On a fixed replay protocol, DECOWAM improved both future-video and action prediction over FastWAM, reducing action MSE by 21.7% with 25.95M trainable adaptation parameters. Across 79 closed-loop trials per method, it achieved the highest observed whole-body coordination and base-displacement robustness among the compared systems, while task completion remained comparable to the strongest baseline. These results show that embodiment-aware factorization can support parameter-efficient joint visual prediction and whole-body control under moving viewpoints.