SV-WAM: An Efficient Surround-View World-Action Model for End-to-End Autonomous Driving
作者: Jinyang Wang, Shiwei Li, Junjian Wang, Zhiqiang Deng, Jianbin Gao, Yihang Zhao, Liu Liu, Yongjia Zhao, Jinlong Chen, Huirui Xu, Yifeng Pan, Kangwei Liu, Fan Ren, Ji Tao, Minghao Yang
分类: cs.CV, cs.RO
发布日期: 2026-09-03
备注: 23 pages, 16 figures
💡 一句话要点
提出SV-WAM以解决传统世界模型在自主驾驶中的局限性
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 世界模型 自主驾驶 视频预测 动作学习 可微分正则化 安全规划 多摄像头融合
📋 核心要点
- 现有的世界模型在推理时生成未来视频,导致计算开销大,限制了空间覆盖,影响安全关键操作。
- SV-WAM通过保留六摄像头观测,利用未来视频预测作为训练监督,设计了以动作为中心的因果掩码以提高效率。
- 实验结果表明,SV-WAM在NAVSIMv2和nuScenes基准上实现了最先进的规划性能,推理延迟低且具备良好的迁移能力。
📝 摘要(中文)
世界模型(WMs)在端到端自主驾驶中展示了强大的潜力,通过学习未来场景动态的预测表示。然而,在推理过程中生成未来视频会引入大量计算开销,导致许多近期的驾驶WMs采用单前置摄像头作为输入以实现高效部署。这种设计限制了在安全关键的操作(如变道、并线和转弯)中的空间覆盖。为了解决这一局限性,我们提出了SV-WAM,一个环视世界-动作模型(WAM),在保持高效推理的同时保留完整的六摄像头观测。SV-WAM利用未来视频预测作为共享生成模型中的动作学习的密集训练监督,而不是作为推理时的输出。该设计的核心是一个以动作为中心的因果掩码,防止动作标记在联合动作-视频去噪时关注未来视频标记。因此,视频分支可以在部署时被丢弃,从而实现高效的仅动作规划。此外,我们引入了可微分的可行区域合规正则化器,惩罚车辆足迹角落接近或越过可行边界,从而提高规划安全性和边界意识。在封闭循环的NAVSIMv2基准和开放循环的nuScenes基准上的广泛实验表明,SV-WAM在低推理延迟和竞争性的零-shot迁移能力下实现了最先进的规划性能。
🔬 方法详解
问题定义:论文要解决的问题是现有世界模型在推理时需要生成未来视频,导致计算开销大且空间覆盖不足,影响自主驾驶的安全性和效率。
核心思路:SV-WAM的核心思路是保留六个摄像头的观测数据,通过未来视频预测作为训练监督,而不是在推理时生成视频,从而提高推理效率和安全性。
技术框架:SV-WAM的整体架构包括六个摄像头输入、未来视频预测模块、动作学习模块和可微分的可行区域合规正则化器。该框架通过共享生成模型进行联合训练,确保动作学习的高效性。
关键创新:SV-WAM的关键创新在于引入了以动作为中心的因果掩码,防止动作标记在去噪过程中关注未来视频标记,这一设计使得视频分支可以在部署时被丢弃,从而实现高效的仅动作规划。
关键设计:在关键设计方面,SV-WAM采用了可微分的可行区域合规正则化器,惩罚车辆足迹接近可行边界的情况,增强了规划的安全性和边界意识。
🖼️ 关键图片
📊 实验亮点
SV-WAM在NAVSIMv2和nuScenes基准测试中表现出色,达到了最先进的规划性能,推理延迟低于现有方法,并且在零-shot迁移能力上具有竞争力。这些实验结果表明,SV-WAM在实际应用中具有显著的优势。
🎯 应用场景
SV-WAM的研究成果在自动驾驶领域具有广泛的应用潜力,尤其是在需要高效和安全的实时决策场景中。通过提高规划的安全性和效率,该模型可以应用于各种自动驾驶系统,提升其在复杂环境中的表现,未来可能推动更广泛的智能交通解决方案的发展。
📄 摘要(原文)
World models (WMs) have demonstrated strong potential for end-to-end autonomous driving by learning predictive representations of future scene dynamics. However, generating future videos during inference introduces substantial computational overhead, leading many recent driving WMs to adopt a single front camera as input for efficient deployment. This design restricts spatial coverage in safety-critical maneuvers such as lane changes, merges, and turns. To address this limitation, we propose SV-WAM, a surround-view world-action model (WAM) that preserves full six-camera observations while maintaining efficient inference. SV-WAM leverages future-video prediction as dense training supervision for action learning within a shared generative model, rather than as an inference-time output. At the core of this design is an action-centered causal mask that prevents action tokens from attending to future-video tokens during joint action-video denoising. Consequently, the video branch can be discarded at deployment, enabling efficient action-only planning. Furthermore, we introduce a differentiable drivable-area compliance regularizer that penalizes vehicle-footprint corners approaching or crossing drivable boundaries, improving planning safety and boundary awareness. Extensive experiments on the closed-loop NAVSIMv2 benchmark and the open-loop nuScenes benchmark demonstrate that SV-WAM achieves state-of-the-art planning performance with low inference latency and competitive zero-shot transfer capability.