SUV: Future Scene Understanding as Video Generation for End-to-End Driving

📄 arXiv: 2608.03084v1 📥 PDF

作者: Yibo Yuan, Jiacheng Fu, Jiangtong Zhu, Yi Li, Jianhua Han, Meng Tian, Zhuohan Liu, Zhiwei Xiong, Hang Xu, Jianwu Fang, Jianru Xue

分类: cs.CV

发布日期: 2026-08-04

备注: 16 pages, 5 figures. Code: https://github.com/ASH-2046/SUV


💡 一句话要点

提出SUV框架以解决未来场景理解问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 未来场景理解 视频生成 端到端驾驶 轨迹规划 深度学习

📋 核心要点

  1. 现有方法在未来场景理解中使用特定任务的头部,导致扩展性不足。
  2. SUV框架通过视频生成统一建模未来场景,避免了特定流的视觉预测头。
  3. 实验结果显示SUV在多个基准上超越了现有方法,提升了轨迹规划性能。

📝 摘要(中文)

端到端驾驶需要对未来场景进行连贯理解,但现有方法通过特定任务的头部和输出格式建模这些场景,扩展性有限。我们提出SUV,一个统一的端到端驾驶框架,将未来场景理解视为视频生成,利用预训练的视频基础模型。SUV将未来的外观、语义、相对深度和实例级动态建模为视频流,使用共享的视频专家,而无需特定流的视觉预测头。通过联合视频-动作注意力,动作专家关注所有未来流的潜在表示并生成自我轨迹。实验表明,SUV直接预测所有四个未来流,结构化的未来监督和直接的未来流访问提高了轨迹规划分数。仅使用单个前置摄像头且不进行候选轨迹选择,SUV在NAVSIM-v2的多个分割上超越了广泛的最新方法,在navtest上达到91.0 EPDMS,在navhard上达到36.9。在长尾WOD-E2E基准上,SUV实现了竞争力的RFS 7.94。

🔬 方法详解

问题定义:本论文旨在解决端到端驾驶中的未来场景理解问题,现有方法由于使用特定任务的头部和输出格式,导致扩展性受限,难以有效预测未来场景。

核心思路:论文提出SUV框架,将未来场景理解视作视频生成,利用预训练的视频基础模型,避免了特定流的视觉预测头,从而实现了更高的灵活性和准确性。

技术框架:SUV框架的整体架构包括视频生成模块和动作专家模块。视频生成模块负责建模未来的外观、语义、相对深度和实例级动态,而动作专家模块则通过联合视频-动作注意力机制生成自我轨迹。

关键创新:SUV的主要创新在于将未来场景理解与视频生成相结合,使用共享的视频专家进行建模,避免了传统方法中各流特定的视觉预测头,从而实现了更高的预测准确性和效率。

关键设计:在设计中,SUV采用了结构化的未来监督机制和直接的未来流访问策略,优化了损失函数和网络结构,以提高轨迹规划的性能。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,SUV在NAVSIM-v2的navtest和navhard分割上分别达到了91.0 EPDMS和36.9的优异表现,超越了多种最新的基准方法。此外,在长尾WOD-E2E基准上,SUV也实现了7.94的竞争性RFS,显示出其在复杂场景下的强大能力。

🎯 应用场景

SUV框架在自动驾驶领域具有广泛的应用潜力,能够有效提升车辆在复杂环境中的决策能力。其视频生成的方式为未来场景理解提供了一种新的思路,可能在智能交通、无人驾驶汽车等领域产生深远影响。

📄 摘要(原文)

End-to-end driving requires a coherent understanding of future scenes, yet existing methods model these scenes using task-specific heads and output formats, with limited scalability. Can video generation instead provide a shared predictor? We introduce SUV, a unified end-to-end driving framework that casts future Scene Understanding as Video generation using a pretrained video foundation model. SUV models future appearance, semantics, relative depth, and instance-level dynamics as video streams with a shared video expert, without stream-specific visual prediction heads. Through joint video-action attention, the action expert attends to the latent representations of all future streams and generates the ego trajectory. Experiments show that SUV directly predicts all four future streams, while controlled ablations show that structured future supervision and direct future-stream access yield higher trajectory planning scores. With only a single front camera and no candidate-trajectory selection, SUV outperforms a broad set of recent state-of-the-art methods on both NAVSIM-v2 splits, achieving 91.0 EPDMS on navtest and 36.9 on navhard. On the long-tail WOD-E2E benchmark, SUV achieves a competitive RFS of 7.94.