GaussianDream++: Efficient 3D Gaussian World Modeling for Robotic Manipulation

📄 arXiv: 2608.25659v1 📥 PDF

作者: Yuqing Jiang, Zijian Zhang, Weitao Zhou, Jiawei Wang, Junjie He, Lei Yang, Haifang Qing, Si Liu, Ding Zhao, Ping Luo, Haibao Yu

分类: cs.RO

发布日期: 2026-08-26

备注: 17 pages, 4 figures


💡 一句话要点

提出GaussianDream++以提升机器人操作中的3D建模效率

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture) 支柱三:空间感知与语义 (Perception & Semantics) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 机器人操作 三维建模 动态预测 视觉-语言-动作 高斯重建 深度学习 智能机器人 自动化技术

📋 核心要点

  1. 现有的视觉-语言-动作策略在三维结构建模和动态预测方面存在监督不足的问题,导致机器人操作的效率和准确性受限。
  2. 论文提出的GaussianDream++通过引入世界状态令牌和世界预测令牌,优化了VLA骨干网络,增强了三维建模的有效性和准确性。
  3. 实验结果显示,GaussianDream++在多个基准测试中表现优异,特别是在LIBERO和LIBERO-Plus上取得了显著的性能提升,实际机器人实验成功率也有明显提高。

📝 摘要(中文)

视觉-语言-动作(VLA)策略在语言条件下的机器人操作中取得了进展,但现有的动作模仿目标对三维结构和短期物理演变的监督较弱。几何增强策略主要改善当前场景的基础,而预测策略通常在RGB或潜在空间中建模未来动态,可能导致高昂的部署成本。GaussianDream展示了训练时当前高斯重建和未来高斯预测提供有效的三维监督,但其密集的VGGT/TGE基础前缀共同携带状态、动态和动作条件信息。我们提出了GaussianDream++,一种紧凑的、策略原生的扩展,直接将世界状态令牌和世界预测令牌插入VLA骨干网络中。一个仅用于训练的世界表示头将这些令牌解码为当前世界和基于共享高斯原语的耦合未来预测,同时静态-动态因子化保留持久结构并将残余运动集中在交互相关区域。在推理时,头、渲染器、辅助目标和VGGT/TGE路径被移除,仅保留20个世界令牌,无需在线高斯解码或回放。该方法在LIBERO上取得了98.6%的准确率,在LIBERO-Plus上达到了87.8%,在相机和布局变化下有明显提升。实际机器人实验进一步将平均成功率从29.2%提高到52.5%,同时保持高效的闭环控制。

🔬 方法详解

问题定义:本论文旨在解决现有视觉-语言-动作策略在三维建模和动态预测中的监督不足问题,导致机器人操作的效率和准确性受限。

核心思路:GaussianDream++通过引入世界状态令牌和世界预测令牌,直接嵌入到VLA骨干网络中,以实现更有效的三维监督和动态预测,从而提升机器人操作的性能。

技术框架:该方法的整体架构包括一个训练专用的世界表示头,该头将令牌解码为当前世界和未来预测,同时通过静态-动态因子化来保留持久结构。推理阶段则移除多余模块,仅保留必要的世界令牌。

关键创新:GaussianDream++的核心创新在于其紧凑的设计,能够在不需要在线高斯解码或回放的情况下,仅通过20个世界令牌实现高效的三维建模和动态预测,显著提高了效率。

关键设计:在模型设计中,采用了共享高斯原语的方式进行当前世界和未来预测的解码,同时在损失函数中引入了静态-动态因子化的策略,以确保模型在动态环境中的适应性和准确性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在实验中,GaussianDream++在LIBERO数据集上达到了98.6%的准确率,在LIBERO-Plus上达到了87.8%。此外,实际机器人实验的成功率从29.2%提升至52.5%,显示出该方法在动态环境下的显著优势。

🎯 应用场景

GaussianDream++的研究成果在机器人操作、自动化制造、智能家居等领域具有广泛的应用潜力。通过提升机器人对三维环境的理解和动态预测能力,该方法能够显著提高机器人在复杂任务中的表现,推动智能机器人技术的进步。

📄 摘要(原文)

Vision-Language-Action (VLA) policies have advanced language-conditioned robotic manipulation, yet action-imitation objectives provide only weak supervision for metric 3D structure and short-horizon physical evolution. Geometry-enhanced policies mainly improve current-scene grounding, whereas predictive policies often model future dynamics in RGB or latent spaces and may incur substantial deployment cost. GaussianDream demonstrates that training-time current Gaussian reconstruction and future Gaussian prediction provide effective 3D supervision, but its dense VGGT/TGE-based prefix jointly carries state, dynamics, and action-conditioning information. We present \textbf{\methodname}, a compact, policy-native extension that inserts \textbf{World State Tokens} and \textbf{World Prediction Tokens} directly into the VLA backbone. A training-only \textbf{World Representation Head} decodes these tokens into a Current World and coupled Future Prediction over shared Gaussian primitives, while static--dynamic factorization preserves persistent structure and focuses residual motion on interaction-relevant regions. At inference, the head, renderer, auxiliary objectives, and VGGT/TGE pathway are removed, leaving only 20 world tokens without online Gaussian decoding or rollout. \method achieves \textbf{98.6\%} on LIBERO and \textbf{87.8\%} on LIBERO-Plus, with clear gains under Camera and Layout shifts. Real-robot experiments further improve average success from 29.2\% to 52.5\% over reproduced $π_{0.5}$ while maintaining efficient closed-loop control.