DECOWAM: Decoupled Whole-Body World-Action Model for Legged Mobile Manipulation
作者: Siyuan Ma, Boshi Zhang, Yutian Zhang, Qinglian Wu, Jiaqi Zhai, Dong Wei, Qiaojun Yu
分类: cs.AI, cs.RO
发布日期: 2026-08-20 (更新: 2026-08-21)
备注: 8 pages, 5 figures. Introduces DECOWAM, a decoupled whole-body world-action model for legged mobile manipulation, and the ARMDOG real-robot dataset
💡 一句话要点
提出DECOWAM以解决移动操控中的视觉预测问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control)
关键词: 移动操控 视觉预测 全身控制 机器人学习 多模态数据
📋 核心要点
- 现有的世界-动作模型未能有效区分相机自我运动与基座和手臂的动作,导致移动操控中的视觉预测不准确。
- DECOWAM通过专门的条件接口分离相机运动与机器人动作,采用冻结的FastWAM骨干网络和训练的残差适配器进行联合视觉预测。
- 实验结果表明,DECOWAM在未来视频和动作预测上显著优于FastWAM,动作均方误差降低21.7%,且在全身协调性和基座位移鲁棒性方面表现最佳。
📝 摘要(中文)
移动操控要求机器人预测行走和手臂动作如何共同影响未来观察和控制。现有的世界-动作模型主要针对固定基座平台,未能明确区分相机自我运动与基座和手臂动作。本文提出DECOWAM,一个全身世界-动作模型,通过专门的条件接口分离这些因素。DECOWAM冻结了改进的FastWAM骨干网络,并训练残差适配器,从特权观察中提取的动作等效未来瓶颈,敌对分离的基座和手臂潜变量,以及用于视频预测的基座速度条件。我们还引入了ARMDOG,一个同步视频、全身状态和动作及语言的真实机器人数据集。在固定重放协议下,DECOWAM在未来视频和动作预测上均优于FastWAM,动作均方误差降低了21.7%。在79个闭环试验中,其全身协调性和基座位移鲁棒性均优于比较系统,同时任务完成情况与最强基线相当。这些结果表明,具身意识的因子化可以支持参数高效的联合视觉预测和在移动视点下的全身控制。
🔬 方法详解
问题定义:本文旨在解决移动操控中机器人如何准确预测行走和手臂动作对未来观察的影响。现有方法未能有效区分相机自我运动与基座和手臂动作,导致预测精度不足。
核心思路:DECOWAM通过专门的条件接口将相机运动与机器人动作分离,采用冻结的FastWAM骨干网络并训练残差适配器,以提高视觉预测的准确性和效率。
技术框架:DECOWAM的整体架构包括一个冻结的FastWAM骨干网络、残差适配器、动作等效未来瓶颈、敌对分离的基座和手臂潜变量,以及基座速度条件模块,形成一个完整的预测流程。
关键创新:DECOWAM的主要创新在于其具身意识的因子化设计,能够有效分离相机运动与机器人动作,从而在移动视点下实现更高效的联合视觉预测。
关键设计:在技术细节上,DECOWAM使用了25.95M可训练的适配参数,优化了损失函数以提高预测精度,并通过敌对训练方法增强了基座和手臂潜变量的分离效果。
🖼️ 关键图片
📊 实验亮点
DECOWAM在固定重放协议下显著提升了未来视频和动作预测的性能,动作均方误差降低了21.7%。在79个闭环试验中,其全身协调性和基座位移鲁棒性均优于其他比较系统,显示出其在移动操控任务中的优势。
🎯 应用场景
该研究的潜在应用领域包括服务机器人、自动化仓储和家庭机器人等场景,能够提升机器人在动态环境中的操控能力和视觉理解能力。未来,DECOWAM的技术可以推广到更复杂的多模态交互任务中,进一步推动智能机器人技术的发展。
📄 摘要(原文)
Mobile manipulation requires a robot to predict how locomotion and arm motion jointly alter future observations and control. Existing world-action models, developed largely for fixed-base platforms, do not explicitly distinguish camera ego-motion from base and arm actions. Here we introduce DECOWAM, a whole-body world-action model that separates these factors through dedicated conditional interfaces. DECOWAM freezes an adapted FastWAM backbone and trains residual adapters, an action-equivalent future bottleneck distilled from privileged observations, adversarially separated base and arm latents, and base-velocity conditioning for video prediction. We further introduce ARMDOG, a real-robot dataset that synchronizes video, whole-body state and action, and language. On a fixed replay protocol, DECOWAM improved both future-video and action prediction over FastWAM, reducing action MSE by 21.7% with 25.95M trainable adaptation parameters. Across 79 closed-loop trials per method, it achieved the highest observed whole-body coordination and base-displacement robustness among the compared systems, while task completion remained comparable to the strongest baseline. These results show that embodiment-aware factorization can support parameter-efficient joint visual prediction and whole-body control under moving viewpoints.