Spatially Aware World Action Model via Geometric Latent Diffusion

📄 arXiv: 2609.02531v1 📥 PDF

作者: Javier Alejandro Lopetegui Gonzalez, Paul Pacaud, Cordelia Schmid

分类: cs.CV, cs.RO

发布日期: 2026-09-02


💡 一句话要点

提出空间感知世界行动模型以解决3D信息缺失问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 世界行动模型 空间感知 3D建模 视频扩散模型 机器人策略学习 多模态融合

📋 核心要点

  1. 现有的世界行动模型仅依赖RGB观察,未能有效利用3D信息,限制了其在机器人策略学习中的应用。
  2. 本文提出的SA-WAM模型通过重新利用预训练的视频模型,实现了RGB和深度信息的联合预测,增强了3D感知能力。
  3. SA-WAM在RoboCasa和LIBERO-Plus基准测试中表现优异,并在真实环境中使用UR5机器人臂时显著提升了预测准确性。

📝 摘要(中文)

世界行动模型(WAMs)利用大规模预训练的视频扩散模型共同预测未来观察和动作,继承了来自互联网规模视频的丰富视觉和物理先验。然而,现有模型仅基于RGB观察,未能利用3D信息。为此,本文提出了空间感知世界行动模型(SA-WAM),该模型重新利用预训练的视频模型,实现动作、RGB和深度的联合预测,从而在单一扩散骨干网络中实现3D感知的世界建模和动作预测。通过非线性编码将无限深度信号映射到冻结的VAE标记器所期望的有界输入域,SA-WAM在RoboCasa和LIBERO-Plus基准测试上取得了最先进的结果,并在使用UR5机器人臂的真实世界评估中超越了强基线,显示出在随机环境中的显著提升。

🔬 方法详解

问题定义:本文旨在解决现有世界行动模型在仅依赖RGB观察时无法有效利用3D信息的问题。这种局限性影响了模型在复杂环境中的表现。

核心思路:SA-WAM通过重新利用预训练的视频模型,结合RGB和深度信息进行联合预测,从而实现3D感知的世界建模。该设计旨在保留预训练模型的优势,同时引入几何信息。

技术框架:SA-WAM的整体架构包括一个视频扩散模型作为骨干,采用非线性编码将深度信号映射到VAE标记器的输入域。模型的主要模块包括动作预测、RGB和深度信息的联合处理。

关键创新:SA-WAM的核心创新在于其能够在不进行3D特定微调的情况下,利用预训练的VAE标记器来处理几何信息,这一设计与现有模型的单一RGB处理方式形成鲜明对比。

关键设计:在模型设计中,采用了非线性编码技术,确保深度信号的有效映射。此外,损失函数的设计也考虑了多模态信息的融合,以提升模型的整体性能。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

SA-WAM在RoboCasa和LIBERO-Plus基准测试中达到了最先进的结果,并在使用UR5机器人臂的真实环境评估中超越了强基线,显示出在随机环境中的显著提升,具体性能数据未提供。

🎯 应用场景

SA-WAM的研究成果在机器人策略学习、自动驾驶、虚拟现实等领域具有广泛的应用潜力。通过增强模型对3D环境的理解能力,SA-WAM能够为复杂任务提供更准确的预测,提升机器人在动态环境中的决策能力。

📄 摘要(原文)

World Action Models (WAMs) leverage the capabilities of large-scale pretrained video diffusion models to jointly predict future observations and actions, inheriting rich visual and physical priors from internet-scale video. This has made them a promising paradigm for robot policy learning, yet the prevailing models operate exclusively on RGB observations and do not leverage 3D information. To bridge this gap, we introduce a Spatially Aware World Action Model (SA-WAM), which repurposes a pretrained video model for joint action, RGB, and depth prediction, enabling 3D-aware world modeling and action prediction within a single diffusion backbone. We use a nonlinear encoding that maps the unbounded depth signal into the bounded input domain expected by the frozen VAE tokenizer. This allows us to reuse the tokenizer without 3D-specific fine-tuning, incorporating geometric information without sacrificing the pretrained priors. SA-WAM achieves state-of-the-art results on the RoboCasa and LIBERO-Plus benchmarks, while simultaneously improving future-state predictions. Furthermore, SA-WAM outperforms strong baselines in real-world evaluation using a UR5 robotic arm, with strong gains in randomized environments. We analyze the correlation between world model prediction quality and rollout success, providing insights into WAM performance and avenues for its improvement.