DriveVLA-M0: Failure-Aware Memory Augmentation for Autonomous Driving
作者: Zebin Xing, Yupeng Zheng, Qiang Chen, Linbo Wang, Yichen Zhang, Pengxuan Yang, Junli Wang, Deheng Qian, Xiaoqing Ye, Junyu Han, Yifeng Pan, Qichao Zhang, Dongbin Zhao
分类: cs.CV
发布日期: 2026-08-11
🔗 代码/项目: GITHUB
💡 一句话要点
提出DriveVLA-M0以解决自主驾驶中的失败适应问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 自主驾驶 视觉-语言-动作 失败适应 潜在记忆 检索增强模型 动态环境 智能交通 机器学习
📋 核心要点
- 现有的VLA模型在处理过去失败的场景时缺乏有效的适应机制,导致性能下降。
- DriveVLA-M0通过构建潜在记忆池和专门的检索模型,增强了模型对失败案例的记忆和利用能力。
- 在NAVSIMv1和NAVSIMv2基准测试中,DriveVLA-M0达到了94.1 PDMS和47.0 EPDMS的优异性能,且测试时延迟仅为26.44毫秒。
📝 摘要(中文)
视觉-语言-动作(VLA)模型最近成为端到端自主驾驶的有前景的范式,能够在感知、语言和规划之间进行统一推理。然而,现有方法缺乏利用过去失败或适应分布变化的机制,导致模型在类似场景中持续表现不佳。本文提出DriveVLA-M0,一种具有失败感知潜在记忆的检索增强VLA。我们构建了一个潜在记忆池,存储失败案例及其结构场景表示和专家轨迹标签,并设计了一个专门的检索模型,解耦静态道路结构和动态代理交互,以实现结构化检索。在推理时,通过轻量级的解耦LoRA基础测试时训练机制将检索到的案例注入模型,实现针对性和场景特定的修正。大量实验表明,我们的方法在NAVSIMv1和NAVSIMv2基准上始终优于先前的方法。
🔬 方法详解
问题定义:本文旨在解决自主驾驶模型在面对过去失败案例时的适应性不足问题。现有方法未能有效利用历史失败数据,导致在相似场景中重复出现性能下降。
核心思路:DriveVLA-M0的核心思路是构建一个潜在记忆池,存储失败案例及其相关信息,并通过检索机制在推理时进行针对性修正。这种设计使得模型能够在遇到类似场景时,快速参考并调整策略。
技术框架:DriveVLA-M0的整体架构包括潜在记忆池、检索模型和轻量级的LoRA基础测试时训练机制。潜在记忆池存储失败案例,检索模型负责从中提取相关信息,而LoRA机制则在推理时将检索到的案例注入模型。
关键创新:本研究的关键创新在于引入了失败感知的潜在记忆机制和结构化检索模型,显著提升了模型在动态环境中的适应能力。这与传统方法的静态学习方式形成鲜明对比。
关键设计:在设计上,潜在记忆池包含失败案例的结构场景表示和专家轨迹标签,检索模型则通过解耦静态道路结构与动态代理交互来实现高效检索。测试时的LoRA机制确保了模型在不修改主干网络的情况下进行快速适应。
🖼️ 关键图片
📊 实验亮点
在NAVSIMv1和NAVSIMv2基准测试中,DriveVLA-M0实现了94.1 PDMS和47.0 EPDMS的优异性能,相较于之前的方法有显著提升。同时,测试时的反向延迟仅为26.44毫秒,显示出良好的实时性。
🎯 应用场景
DriveVLA-M0的研究成果在自主驾驶领域具有广泛的应用潜力,尤其是在复杂和动态环境中。通过有效利用历史失败数据,该模型能够提高自主驾驶系统的安全性和可靠性,减少事故发生率。此外,该方法的可扩展性使得其在未来的智能交通系统中具有重要价值。
📄 摘要(原文)
Vision-Language-Action (VLA) models have recently emerged as a promising paradigm for end-to-end autonomous driving by enabling unified reasoning across perception, language, and planning. However, existing approaches lack mechanisms to exploit past failures or adapt to distribution shifts, causing the model to persistently underperform on similar scenarios where it has previously failed. In this paper, we propose DriveVLA-M0, a retrieval-augmented VLA with failure-aware latent memory. We construct a latent memory pool that stores failure cases along with their structure scene representations and expert trajectory labels, and design a dedicated Retrieve Model that decouples static road structure and dynamic agent interactions to enable structurally grounded retrieval. At inference time, retrieved cases are injected into the model via a lightweight decoupled LoRA-based test-time training (TTT) mechanism, allowing targeted and scenario-specific correction without modifying the backbone. Extensive experiments on NAVSIMv1 and NAVSIMv2 benchmark demonstrate that our approach consistently outperforms prior methods, achieving 94.1 PDMS on Navtest and 47.0 EPDMS on Navhard with only 26.44 ms TTT backward latency overhead. Furthermore, we show that DriveVLA-M0 scales effectively with additional memory, enabling training-free performance gains through memory expansion. The code is available at https://github.com/ZebinX/DriveVLA-M0.