World Tokens: Enhancing Embodied Policies with Training-Time World Modeling
作者: Qu Tang, Benhui Zhuang, Bo Yuan, Xue Yu, Longteng Guo, Junlan Feng
分类: cs.CV
发布日期: 2026-08-10
💡 一句话要点
提出World Tokens以提升具身策略的训练时世界建模能力
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱八:物理动画 (Physics-based Animation) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 视觉-语言-动作 世界建模 具身策略 未来视频去噪 多模态学习 机器人控制 动态环境
📋 核心要点
- 现有的VLA模型在处理物理场景演变时存在不足,未能有效利用世界建模信息。
- 提出的World Tokens架构通过世界适配器将视觉-语言特征转换为世界标记,增强动作策略的训练效果。
- 在LIBERO和SIMPLER数据集上,World Tokens表现出色,显著提高了实际应用中的成功率,并在VLA级别延迟下生成动作片段。
📝 摘要(中文)
视觉-语言-动作(VLA)模型是具身策略中广泛采用的范式,尽管其在闭环控制中表现出色,但并未明确建模任务展开时物理场景的演变。近期出现的世界-动作模型(WAMs)利用预训练的视频世界模型捕捉时空演变,但在控制环中保留未来生成或大型视频骨干网络会显著增加推理成本。本文提出World Tokens,一种围绕世界适配器构建的具身策略架构,旨在通过训练时的世界建模来增强动作策略,同时保持高效的部署。具体而言,世界适配器将VLM特征转换为固定集的世界标记,这些标记为联合微调的未来视频去噪器提供条件,同时作为动作专家的唯一视觉-语言上下文。此共享条件使得未来视频去噪的梯度直接影响动作预测的表示,而独占路由则防止策略绕过该表示。在部署时,世界模型分支被移除,仅保留VLM、世界适配器和动作专家,无需在线视频模型推理。
🔬 方法详解
问题定义:本文旨在解决现有VLA模型在任务执行过程中未能有效建模物理场景演变的问题,导致控制策略的局限性。
核心思路:通过引入世界适配器,将视觉-语言特征转化为世界标记,在训练过程中利用世界建模来增强动作策略,同时确保在部署时的高效性。
技术框架:整体架构包括三个主要模块:视觉-语言模型(VLM)、世界适配器和动作专家。世界适配器负责将VLM特征转换为世界标记,并为未来视频去噪器提供条件。
关键创新:最重要的创新在于通过共享条件使得未来视频去噪的梯度直接影响动作预测的表示,同时通过独占路由防止策略绕过该表示,这一设计显著提升了模型的表现。
关键设计:在模型设计中,采用固定集的世界标记作为条件输入,确保了模型在推理时的高效性,并且在训练过程中使用联合微调的方式来优化未来视频去噪器和动作预测的协同效果。
🖼️ 关键图片
📊 实验亮点
在LIBERO数据集上,World Tokens在没有进行具身动作预训练的情况下,表现出色,达到了最佳的报告平均值,并在SIMPLER数据集上显著提高了成功率,尤其在实际应用中,相较于匹配的仅动作基线,R1 Pro成功率有显著提升。
🎯 应用场景
该研究的潜在应用场景包括机器人控制、自动驾驶和虚拟现实等领域,能够有效提升这些系统在复杂动态环境中的决策能力和执行效率。未来,World Tokens有望推动更高效的具身智能体的发展,增强其在真实世界中的适应性和表现。
📄 摘要(原文)
Vision-language-action (VLA) models are a widely adopted paradigm for embodied policies. They excel at efficient closed-loop control but do not explicitly model how physical scenes evolve as a task unfolds. Recently emerging world-action models (WAMs) leverage pretrained video world models to capture spatiotemporal evolution, yet retaining future generation or a large video backbone in the control loop substantially increases inference cost. We introduce World Tokens, an embodied policy architecture built around a World Adapter that bridges visual-language understanding, world-dynamics modeling, and action generation. It uses world modeling during training to enhance the action policy while preserving efficient deployment. Specifically, the World Adapter transforms VLM features into a fixed set of world tokens, which condition a jointly fine-tuned future-video denoiser and simultaneously serve as the action expert's sole visual-language context. This shared conditioning allows gradients from future-video denoising to directly shape the representation used for action prediction, while exclusive routing prevents the policy from bypassing that representation. At deployment, the world-model branch is removed, leaving only the VLM, World Adapter, and action expert, with no online video-model inference. With a 2B backbone and no embodied action pretraining, World Tokens is highly competitive on LIBERO, attains the best reported averages on SIMPLER, substantially improves real-world R1 Pro success over a matched action-only baseline, and generates each action chunk at VLA-level latency.