GUARD: Grounding Uncertainty and Ablation-Based Risk Detection for Diffusion-Based VLAs
作者: Suhas Hegde, Jitendra Yasaswi Bharadwaj Katta
分类: cs.RO, cs.AI
发布日期: 2026-08-05
💡 一句话要点
提出GUARD以解决扩散基础视觉语言行动的风险检测问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 扩散模型 视觉语言行动 故障检测 多模态学习 实时监测 风险评估 智能系统
📋 核心要点
- 现有的扩散基础视觉语言行动策略在处理弱基础的视觉和语言证据时存在生成合理动作的挑战。
- GUARD通过不修改预训练策略的方式,利用KV缓存中的条目影响评估来检测故障,构建反事实缓存进行比较。
- GUARD在五个策略基准设置中表现优异,未见任务的ROC-AUC平均提升5.73个百分点,显示出其有效性。
📝 摘要(中文)
扩散基础的视觉语言行动(VLA)策略能够在视觉和语言证据较弱的情况下生成合理的动作。本文提出GUARD,一种测试时故障检测方法,旨在测量这种基础而不需修改预训练策略。GUARD通过评估最终视觉语言模型的关键值(KV)缓存中的标记索引条目的影响,构建反事实缓存并对比其去噪响应,从而生成包括敏感性、注意力熵、模态偏差和基础效率的诊断流。实验表明,GUARD在五个策略基准设置中表现优异,尤其在未见任务设置中,ROC-AUC提升显著,展示了其在多策略、多任务和多领域中的可转移性故障信号能力。
🔬 方法详解
问题定义:本文旨在解决扩散基础视觉语言行动策略在视觉和语言证据较弱时生成合理动作的风险检测问题。现有方法未能有效识别这些潜在的故障,导致生成的动作可能不可靠。
核心思路:GUARD的核心思路是通过评估KV缓存中标记索引条目的影响,构建反事实缓存并比较其去噪响应,从而在不修改预训练策略的情况下检测故障。这样的设计使得GUARD能够实时监测并提供故障信号。
技术框架:GUARD的整体架构包括几个主要模块:首先,评估KV缓存中条目的影响;其次,构建反事实缓存;最后,通过对比去噪响应生成诊断流,包括敏感性、注意力熵等指标,并由轻量级时间分类器处理。
关键创新:GUARD的主要创新在于其能够在不干扰预训练策略的情况下,直接探测多模态证据对动作头的依赖性,从而提供可转移的故障信号。这与现有方法的本质区别在于其不需要修改模型结构。
关键设计:GUARD的关键设计包括在线标定的诊断流,涉及敏感性、注意力熵、模态偏差和基础效率等参数,采用轻量级的时间分类器进行处理,确保了实时性和准确性。实验中使用的损失函数和网络结构经过精心设计,以优化故障检测的效果。
🖼️ 关键图片
📊 实验亮点
GUARD在五个未见任务设置中表现优异,四个设置的ROC-AUC达到最佳,另一个设置排名第二,平均提升5.73个百分点,相较于最强竞争对手的运行监控,且与最佳已见任务平均相差仅0.19点,显示出其卓越的性能。
🎯 应用场景
GUARD的研究成果在多个领域具有潜在应用价值,尤其是在自动驾驶、机器人控制和智能助手等需要实时决策的场景中。通过有效检测和识别故障,GUARD能够提高系统的可靠性和安全性,促进智能系统的广泛应用和发展。
📄 摘要(原文)
Diffusion-based vision-language-action (VLA) policies can generate plausible actions even when their predictions are weakly grounded in the visual and language evidence defining the task. We introduce GUARD, a test-time failure detection method that measures this grounding without modifying the pretrained policy. GUARD estimates the influence of token-indexed entries in the final vision-language model key-value (KV) cache, constructs counterfactual caches by ablating salient KV entries, and compares their denoising responses with the original conditioning. Based on the comparison, we derive GUARD diagnostic stream including sensitivity, attention entropy, modality bias, and grounding efficiency, which are calibrated online and processed by a lightweight temporal classifier. We evaluate GUARD under task-held-out splits across five policy-benchmark settings, using Pi0, SmolVLA, and Alpamayo-1.5 on LIBERO, SimplerEnv, MetaWorld, and PhysicalAI-AV. GUARD achieves the best ROC-AUC on four of five unseen-task settings and ranks second on the remaining setting, improving the average unseen-task ROC-AUC by 5.73 percentage points over the strongest competing runtime monitor while remaining within 0.19 points of the best seen-task average. These results show that directly probing action-head dependence on multimodal evidence provides a transferable failure signal across policies, tasks, embodiments, and domains.