SimWAM: A Simple World Action Model for End-to-End Autonomous Driving
作者: Zongchuang Zhao, Xin Zhou, Tianyang Xu, Zhengyang Sun, Kaixuan Zhou, Honglin Li, Dingkang Liang, Xiang Bai
分类: cs.CV
发布日期: 2026-08-07
备注: The code and model weights are available at https://github.com/H-EmbodVis/SimWAM/
🔗 代码/项目: GITHUB
💡 一句话要点
提出SimWAM以解决端到端自主驾驶中的未来生成问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 自主驾驶 世界动作模型 视频生成 强化学习 轨迹预测 轻量级模型 联合训练
📋 核心要点
- 现有的世界动作模型在推理阶段需要昂贵的未来生成,限制了其在自主驾驶中的应用效率。
- SimWAM通过将视频生成仅作为训练信号,设计了一个轻量级的动作专家与预训练视频专家的联合训练机制。
- SimWAM在NAVSIM上实现了91.5 PDMS,显著降低了延迟,并成功实现了对nuScenes的零-shot迁移。
📝 摘要(中文)
世界动作模型(WAMs)通过将视频动态先验转移到动作预测中来改善端到端自主驾驶,但现有方法在推理时需要昂贵的未来生成。我们提出SimWAM,这是一种简单而有效的WAM,仅将视频生成作为训练信号。它通过联合流匹配共同训练一个预训练的视频专家和一个轻量级的动作专家。一个独立的注意力掩码使得动作预测与未来帧无关,从而在训练后可以丢弃视频分支,留下一个自包含的规划器,直接预测轨迹。由于两个专家没有共享参数,仅通过统一的注意力接口进行交互,因此视频骨干可以被替换,动作专家可以独立扩展,而无需修改学习目标或推理管道。我们进一步应用强化学习来优化超越轨迹模仿的组合驾驶奖励。SimWAM在NAVSIM上实现了91.5 PDMS,超越了基于WAM的最先进规划器,并且延迟显著降低,能够零-shot迁移到nuScenes。这些结果使SimWAM成为一个简单而稳固的基线,能够从视频生成的进展中受益,以实现高效的自主驾驶。
🔬 方法详解
问题定义:本论文旨在解决现有世界动作模型在推理阶段需要昂贵的未来生成的问题,这限制了其在自主驾驶中的应用效率。
核心思路:SimWAM的核心思想是将视频生成仅作为训练信号,通过联合训练视频专家和动作专家,使得动作预测与未来帧无关,从而在训练后可以丢弃视频分支。
技术框架:SimWAM的整体架构包括两个主要模块:一个预训练的视频专家和一个轻量级的动作专家。它们通过联合流匹配进行共同训练,并使用独立的注意力掩码来保持动作预测的独立性。
关键创新:SimWAM的关键创新在于其设计的独立注意力接口,使得视频和动作专家之间没有参数共享,允许它们独立扩展和替换,且不影响学习目标或推理流程。
关键设计:在关键设计上,SimWAM采用了联合流匹配的损失函数,确保视频专家和动作专家的有效协同,同时保持了轻量级的网络结构,以提高推理速度。该方法还引入了强化学习来优化组合驾驶奖励,超越了传统的轨迹模仿。
🖼️ 关键图片
📊 实验亮点
SimWAM在NAVSIM上实现了91.5 PDMS,显著超越了现有的基于WAM的规划器,并且在延迟方面表现出明显的优势。此外,该模型成功实现了对nuScenes的零-shot迁移,展示了其良好的泛化能力。
🎯 应用场景
SimWAM的研究成果在自主驾驶领域具有广泛的应用潜力,尤其是在需要高效实时决策的场景中。其轻量级的设计使得该模型能够快速适应不同的驾驶环境,未来可能会推动更智能的自动驾驶系统的开发。
📄 摘要(原文)
World-Action Models (WAMs) improve end-to-end autonomous driving by transferring video dynamics priors to action prediction, but existing methods require costly future generation at inference. We present SimWAM, a simple yet effective WAM that uses video generation purely as a training signal. It co-trains a pretrained video expert and a lightweight action expert with joint flow matching. An isolated attention mask keeps action prediction independent of future frames, allowing the video branch to be discarded after training and leaving a self-contained planner that directly predicts trajectories. Since the two experts share no parameters and interact only through a unified attention interface, the video backbone could be replaced and the action expert scaled independently without modifying the learning objective or inference pipeline. We further apply reinforcement learning to optimize a compositional driving reward beyond trajectory imitation. Our SimWAM achieves $91.5$ PDMS on NAVSIM, surpasses state-of-the-art WAM-based planners with substantially lower latency, and transfers zero-shot to nuScenes. These results position SimWAM as a simple yet solid baseline that could readily benefit from advances in video generation for efficient autonomous driving. The code and model weights are available at https://github.com/H-EmbodVis/SimWAM/