WA-JEPA: Rethinking the Video JEPA Paradigm for World-Action Modeling in Autonomous Driving

📄 arXiv: 2608.20974v1 📥 PDF

作者: Xinlin Wang, Yujiao Xiang, Yuheng Zhou, Jingqi Wang, Minqing Huang, Jiajie Huang, Dongxu Wei, Tingguang Zhou, Xiyang Wang, Gong Chen, Zhi Xu, Feiyang Tan, Hangning Zhou, Mu Yang

分类: cs.CV, cs.AI

发布日期: 2026-08-21

🔗 代码/项目: GITHUB


💡 一句话要点

提出WA-JEPA以解决自主驾驶中的未来预测问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱八:物理动画 (Physics-based Animation)

关键词: 自主驾驶 未来预测 时空建模 自监督学习 条件流匹配 视频理解 深度学习

📋 核心要点

  1. 现有的V-JEPA方法在自主驾驶规划中面临未来预测与动作紧密结合的挑战,导致其不适用。
  2. WA-JEPA通过混合未来掩码预训练和条件流匹配的方式,重新构建了未来预测的框架,提升了模型的预测能力。
  3. 在NAVSIM-v2上,WA-JEPA达到了91.7 EPDMS,超越了现有的基线,验证了其在自主驾驶中的有效性。

📝 摘要(中文)

视频联合嵌入预测架构(V-JEPA)通过自监督的潜在特征预测从视频中学习强大的时空表示。然而,V-JEPA基于随机掩码补全和确定性回归,根本不适合需要与动作紧密结合的未来导向预测的自主驾驶规划。为此,本文重新思考了V-JEPA范式,提出了WA-JEPA,这是一种为自主驾驶规划设计的V-JEPA原生世界-动作模型。WA-JEPA采用混合未来掩码预训练,模型从观察到的上下文推断未来潜在特征。通过将未来预测重新构建为潜在未来的条件流匹配,显著提高了模型生成合理未来潜在特征的能力。最后,提出了一种联合未来-动作预测器,在统一的时空潜在空间中共同去噪未来场景标记和自我轨迹,使动作监督能够直接塑造与规划相关的世界表示。经过在nuPlan视频上的预训练和在NAVSIM上的微调,WA-JEPA在NAVSIM-v2上达到了91.7 EPDMS,超越了最强的端到端和世界-动作基线,且在相同评估协议下,在闭环HUGSIM基准上获得了最佳HD-Score 0.4462。这些结果验证了V-JEPA原生世界-动作建模作为自主驾驶规划的强大且可扩展的范式。

🔬 方法详解

问题定义:本文旨在解决V-JEPA在自主驾驶规划中对未来预测与动作结合不紧密的问题,现有方法的随机掩码补全和确定性回归限制了其应用。

核心思路:WA-JEPA通过混合未来掩码预训练,使模型能够从观察到的上下文推断未来潜在特征,采用条件流匹配来提高未来预测的准确性。

技术框架:WA-JEPA的整体架构包括混合未来掩码预训练和联合未来-动作预测器,前者用于生成未来潜在特征,后者用于去噪未来场景标记和自我轨迹。

关键创新:WA-JEPA的核心创新在于将未来预测视为条件流匹配,这一方法显著提升了生成合理未来潜在特征的能力,与传统的确定性回归方法形成鲜明对比。

关键设计:在模型设计中,采用了特定的损失函数来优化未来潜在特征的生成,同时在网络结构上进行了调整,以适应混合未来掩码的预训练过程。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

WA-JEPA在NAVSIM-v2上达到了91.7 EPDMS,超越了最强的端到端和世界-动作基线,分别提升了1.6和1.3 EPDMS。此外,在闭环HUGSIM基准上,WA-JEPA在相同评估协议下获得了最佳HD-Score 0.4462,显示出其卓越的性能。

🎯 应用场景

WA-JEPA的研究成果在自主驾驶领域具有广泛的应用潜力,能够提升自动驾驶系统的决策能力和安全性。通过更准确的未来预测,该模型可用于复杂环境下的实时规划,推动智能交通系统的发展。

📄 摘要(原文)

Video Joint Embedding Predictive Architecture (V-JEPA) learns powerful spatiotemporal representations from video through self-supervised latent feature prediction. However, V-JEPA is built around random-mask completion and deterministic regression, making it fundamentally ill-suited for autonomous driving planning that demands future-directed prediction tightly coupled with action. To address this, we rethink the V-JEPA paradigm and present WA-JEPA, a V-JEPA-native world-action model designed for autonomous driving planning. Instead of random spatiotemporal masking, WA-JEPA employs hybrid future-masked pre-training, where the model infers future latents from observed context. Departing from deterministic regression, we recast future prediction as conditional flow matching over latent futures, which substantially improves the model's ability to generate plausible future latents for downstream planning. Finally, a joint future-action predictor is proposed to denoise future scene tokens and ego trajectories together in a unified spatiotemporal latent space, allowing action supervision to directly shape planning-relevant world representations. Pre-trained on nuPlan videos and fine-tuned on NAVSIM, WA-JEPA reaches 91.7 EPDMS on NAVSIM-v2, surpassing the strongest end-to-end and world-action baselines by 1.6 and 1.3 EPDMS, and, without HUGSIM-specific fine-tuning, attains the best HD-Score of 0.4462 on the closed-loop HUGSIM benchmark under the same evaluation protocol. These results validate V-JEPA-native world-action modeling as a powerful and scalable paradigm for autonomous driving planning. Code is available at https://github.com/AFARI-Research/WA-JEPA.