DreamX-Phi 1.0: Action-Conditioned Video World Model for Robotic Manipulation

📄 arXiv: 2608.13489v1 📥 PDF

作者: DreamX Team, Rui Chen, Xiangxiang Chu, Geng Li, Jifan Li, Qingfeng Shi, Datao Tang, Jing Tang, Jun Wang, Pengfei Zhang

分类: cs.CV, cs.RO

发布日期: 2026-08-13

备注: Code: https://github.com/AMAP-ML/DreamX-Phi


💡 一句话要点

提出DreamX-Phi 1.0以解决机器人操作中的未来观察预测问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture)

关键词: 机器人操作 视频世界模型 几何编码 深度分支 动作条件预测 蒸馏训练 物体一致性

📋 核心要点

  1. 现有机器人操作模型在预测未来观察时,常常无法准确遵循机械臂的运动路径,导致操作失败。
  2. 论文提出了一种新的动作条件视频世界模型,通过几何编码和深度分支来增强预测的准确性和一致性。
  3. DreamX-Phi 1.0在WorldArena 2.0挑战赛中表现优异,分别获得第一名和第二名,展示了其有效性和应用潜力。

📝 摘要(中文)

我们提出了DreamX-Phi 1.0,这是一种针对机器人操作的动作条件视频世界模型。该模型在给定观察帧、语言指令和预定动作序列的情况下,能够预测未来的观察结果。为了确保预测遵循每个机械臂的指令路径,我们通过PRoPE风格的几何编码将每个机械臂的SE(3)变换注入注意力机制中。此外,我们增加了轻量级的深度分支以处理场景级几何,并使用SAM3掩码与冻结的V-JEPA教师保持抓取过程中的物体一致性。最后,我们通过分布匹配蒸馏将多步生成器提炼为少步学生,以实现高效部署。该模型在WorldArena 2.0挑战赛中获得了第一名和第二名的优异成绩。

🔬 方法详解

问题定义:本论文旨在解决机器人操作中未来观察预测的准确性问题。现有方法在处理复杂动作时,常常无法确保机械臂的运动路径与预期一致,导致抓取失败或物体丢失。

核心思路:我们提出的DreamX-Phi 1.0模型通过引入PRoPE风格的几何编码,确保每个机械臂的运动路径被准确遵循,同时结合深度分支来处理场景几何信息,从而提升预测的准确性。

技术框架:该模型的整体架构包括三个主要模块:动作条件输入模块、几何编码模块和深度分支模块。动作条件输入模块接收观察帧和指令,几何编码模块通过SE(3)变换增强运动路径的准确性,而深度分支模块则负责场景几何的提取。

关键创新:最重要的技术创新在于将几何编码与动作条件模型相结合,确保了机械臂运动的准确性和物体的一致性,这在现有方法中尚未实现。

关键设计:模型采用了轻量级的深度分支,结合SAM3掩码和V-JEPA教师,确保了物体在抓取过程中的一致性。此外,通过分布匹配蒸馏技术,将多步生成器转化为少步学生,提升了模型的部署效率。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在WorldArena 2.0挑战赛中,DreamX-Phi 1.0在Track 1中获得第一名,在Track 2中获得第二名,展示了其在动作条件视频预测中的卓越性能。与基线模型相比,预测准确性和物体一致性有显著提升,具体性能数据未知。

🎯 应用场景

该研究的潜在应用领域包括工业机器人、服务机器人和自动化生产线等。通过提高机器人在复杂环境中的操作能力,DreamX-Phi 1.0可以显著提升生产效率和安全性,未来可能在智能制造和家庭自动化等领域发挥重要作用。

📄 摘要(原文)

We present \textbf{DreamX-Phi 1.0}, an action-conditioned video world model for robotic manipulation that, given an observed frame, a language instruction, and a prescribed action sequence comprising end-effector poses and gripper states, predicts the resulting future observations. Yet realism alone does not guarantee faithfulness: a convincing rollout can still move the wrong arm or lose the manipulated object. To ensure the prediction respects each arm's commanded path, we inject per-arm $\mathrm{SE}(3)$ transformations into attention via \textbf{PRoPE-style geometric encoding}, preserving arm identity and rigid-motion structure. Action control alone does not fully constrain scene geometry or the evolution of small manipulated objects. We therefore add a lightweight \textbf{depth branch} for scene-level geometry and use \textbf{SAM3 masks} with a frozen \textbf{V-JEPA teacher} to maintain object consistency throughout grasping. We further distill the multi-step generator into a few-step student via distribution-matching distillation for efficient deployment. At the time of writing, \model{} achieves first place on Track~1 and second place on Track~2 of the WorldArena~2.0 Challenge. Our model and code will be publicly available.