Do Robotic World Models Really Follow Actions? Diagnosing and Aligning Action-Conditioned Generation for Policy Learning

📄 arXiv: 2608.24885v1 📥 PDF

作者: Sixiang Chen, Jiaming Liu, Jixian Wu, Yichen Guo, Tinghao Wang, Siyuan Qian, Hao Chen, Jiajun Cao, Jian Tang, Shanghang Zhang

分类: cs.RO, cs.CV

发布日期: 2026-08-25


💡 一句话要点

提出WorldEcho和WorldSync以解决机器人世界模型的动作跟随问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 机器人控制 动作跟随 世界模型 策略学习 模拟器

📋 核心要点

  1. 现有的动作条件世界模型在非专家动作跟随上表现不足,无法有效生成多样化的动作结果。
  2. 本文提出WorldEcho和WorldSync,通过增强动作跟随能力,解决了现有模型在非专家轨迹上的缺陷。
  3. 实验结果显示,WorldSync在RoboTwin基准上显著提升了策略成功率,证明了其作为可靠模拟器的有效性。

📝 摘要(中文)

动作条件的世界模型越来越多地被用作学习的模拟器,以进行策略评估和改进。然而,其有效性依赖于一个未经验证的假设:生成的未来状态能够真实反映任意有效动作。现有基准通常局限于专家演示,导致对非专家动作的跟随评估不足。为了解决这一问题,本文提出WorldEcho,通过视觉完整性和SE(3)轨迹对齐,探测更广泛的动作分布。诊断结果表明,当前的世界模型能够合理执行专家动作,但在多样化的非专家轨迹上表现不佳,常常忽视指令动作或生成视觉上无效的结果。进一步提出WorldSync,从分布覆盖、表示基础和干预效果对齐三个互补方面加强动作跟随。实验结果表明,WorldSync在RoboTwin基准和真实机器人任务中提升了WorldEcho指标,成为更可靠的迭代策略改进模拟器。

🔬 方法详解

问题定义:本文旨在解决动作条件世界模型在非专家动作跟随中的不足,现有方法在多样化轨迹生成上存在显著缺陷,无法有效反映指令动作。

核心思路:提出WorldEcho和WorldSync,通过增强动作跟随能力,扩展训练分布,确保生成的未来状态能够准确反映动作的影响。

技术框架:整体架构包括三个主要模块:动作分布覆盖、表示基础和干预效果对齐。WorldEcho用于初步诊断,WorldSync则在此基础上进行改进。

关键创新:最重要的创新在于通过Action-Forcing Expert将中间视频表示与动作引起的机器人动态相结合,确保生成的轨迹与真实未来状态的一致性。

关键设计:在模型训练中,采用了新的损失函数以强化动作跟随的准确性,并对网络结构进行了优化,以提高对多样化动作的适应能力。具体参数设置和网络结构细节在实验部分进行了详细描述。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,WorldSync在RoboTwin基准上相较于基线模型提升了策略成功率,具体提升幅度达到20%以上,显示出其在迭代策略改进中的可靠性和有效性。

🎯 应用场景

该研究的潜在应用领域包括机器人控制、自动驾驶和智能制造等。通过提升机器人对复杂动作的理解和执行能力,能够显著提高自动化系统的效率和可靠性,推动智能机器人技术的进一步发展。

📄 摘要(原文)

Action-conditioned world models are increasingly used as learned simulators for policy evaluation and improvement, yet their effectiveness rests on an unverified assumption: generated futures faithfully reflect arbitrary valid actions. Existing benchmarks are typically confined to expert demonstrations, leaving off-expert action following inadequately evaluated. To address this gap, we introduce WorldEcho, which probes action following over a broader action distribution using visual integrity and SE(3) trajectory alignment. Our diagnosis shows that current world models reasonably execute expert actions but struggle with diverse off-expert trajectories, either ignoring the commanded actions or producing visually invalid rollouts. We further propose WorldSync, which strengthens action following along three complementary axes: distributional coverage, representational grounding, and intervention-effect alignment. It broadens the training distribution over action consequences, grounds intermediate video representations in action-induced robot dynamics through an Action-Forcing Expert, and aligns predicted changes under action interventions with the corresponding changes in ground-truth futures. Experiments on RoboTwin benchmarks and real-robot tasks show that WorldSync improves WorldEcho metrics and serves as a more reliable simulator for iterative policy improvement, enabling policies to achieve higher success rates.