Keep the Future, Drop the Rollout: RIFT for World Action Models
作者: Chushan Zhang, Jinguang Tong, Xuesong Li, Yikai Wang, Hongdong Li
分类: cs.RO, cs.AI
发布日期: 2026-08-12
💡 一句话要点
提出RIFT以解决世界动作模型中的视频回放延迟问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 世界动作模型 机器人控制 未来标记 视频回放 实时决策 深度学习 缓存构建
📋 核心要点
- 现有的世界动作模型依赖于迭代视频回放,这导致了较高的部署延迟,影响了实时应用的效率。
- 本文提出RIFT方法,通过学习的未来标记在一次前向传递中构建完整的未来K/V缓存,避免了迭代回放的需求。
- 在LIBERO任务中,RIFT达到了98.8%的成功率,显著优于传统方法,并减少了68.2%至89.1%的动作块延迟。
📝 摘要(中文)
世界动作模型(WAMs)依赖于预测未来的机器人动作,但迭代视频回放会增加部署延迟。本文探讨了动作生成是否仅需未来表示而非演变的回放轨迹。通过在40个LIBERO任务上对四种WAMs进行实验,发现未来缓存值的掩蔽或重新分配会影响执行效果并降低成功率。尽管如此,对于Joint和Cosmos-2模型,重放固定的最终清理键/值缓存几乎能保持未修改的执行效果。基于此,提出了RIFT(无回放想象通过未来标记),该方法在一次主干传递中构建完整的未来K/V缓存,同时保留原有的未来读取接口。实验结果表明,RIFT在LIBERO上达到了98.8%的成功率,显著减少了动作块延迟。
🔬 方法详解
问题定义:本文旨在解决现有世界动作模型在生成机器人动作时依赖迭代视频回放所带来的高延迟问题。现有方法在执行过程中需要不断更新回放轨迹,导致实时性不足。
核心思路:RIFT方法的核心思想是通过学习的未来标记,直接在一次前向传递中构建未来K/V缓存,从而避免了迭代回放的过程。这种设计旨在提高动作生成的效率和实时性。
技术框架:RIFT的整体架构包括一个主干网络,该网络负责生成未来标记,并利用这些标记构建完整的K/V缓存。该方法保留了原有的未来读取接口,使得与现有系统的兼容性得以保持。
关键创新:RIFT的主要创新在于将未来标记的学习与缓存构建相结合,显著减少了对迭代回放的依赖。这一方法与传统的WAMs在执行过程中需要不断更新缓存的方式有本质区别。
关键设计:在RIFT中,关键参数包括未来标记的学习率和缓存的更新策略。损失函数设计为平衡未来标记的准确性与执行效率,网络结构则采用了深度学习中的卷积神经网络,以提高特征提取能力。
🖼️ 关键图片
📊 实验亮点
实验结果显示,RIFT在LIBERO任务上达到了98.8%的成功率,接近传统方法的98.4%至98.6%,同时动作块延迟减少了68.2%至89.1%。在RoboTwin 2.0上,RIFT在干净和随机场景中分别达到了92.9%和92.6%的成功率,表现优于其他评估方法。
🎯 应用场景
该研究的潜在应用领域包括机器人控制、自动驾驶、智能制造等需要实时决策的场景。通过减少动作生成的延迟,RIFT能够提升机器人在动态环境中的适应能力和执行效率,具有重要的实际价值和未来影响。
📄 摘要(原文)
World action models (WAMs) condition robot actions on predicted futures, but iterative video rollout increases deployment latency. We ask whether action generation requires the evolving rollout trajectory or only its future representation. Across four WAMs on all 40 LIBERO tasks, paired closed-loop interventions show that masking or reassigning future-cache values changes execution and reduces success, indicating sensitivity to future values and their assigned positions. For Joint and Cosmos-2, however, replaying one fixed final-clean key/value (K/V) cache nearly preserves unmodified execution, with $1.7$ to $1.9$~cm end-effector average displacement error and $97.9\%$ to $98.2\%$ success. This separates cache consumption from production: these models can reuse a fixed cache but still require iterative rollout to construct it. We therefore propose RIFT (\emph{Rollout-free Imagination via Future Tokens}), which uses learned anticipation tokens to construct a complete future K/V cache in one backbone pass while retaining the original future-read interface. On LIBERO, RIFT achieves $98.8\%$ success, close to rollout-based Joint, IDM, and LingBot-VA at $98.4\%$ to $98.6\%$, while reducing action-chunk latency by $68.2\%$ to $89.1\%$. On RoboTwin~2.0, RIFT reaches $92.9/92.6\%$ on clean/randomized scenes, the highest observed among the evaluated methods. These results support rollout-free future conditioning without iterative video generation at deployment.