Coverage Aware Active Evaluation for Failure Discovery with Paired Systems
作者: Anjali Parashar, Rachel Luo, Apoorva Sharma, Sushant Veer, Edward Schmerling, Carson Sobolewski, Mingxin Yu, Chuchu Fan, Marco Pavone
分类: cs.AI, cs.RO
发布日期: 2026-08-13
备注: 9 main pages followed by Appendix, total 21 pages, 12 figures
💡 一句话要点
提出覆盖感知主动评估方法以发现系统故障
🎯 匹配领域: 支柱一:机器人控制 (Robot Control)
关键词: 自主系统 故障发现 代理评估 深度学习 控制变量 互信息 多样性
📋 核心要点
- 现有方法在有限测试预算下难以有效发现自主系统的稀有和异质故障,导致真实故障发现的挑战。
- 本文提出的自适应故障发现方法结合了代理评估与有限目标系统结果,通过校正代理信号来提高故障预测的准确性。
- 实验表明,该方法在多个任务中发现的故障数量是随机采样和主动学习基线的两倍,显著提升了故障发现的效率和多样性。
📝 摘要(中文)
自主系统可能以稀有且异质的方式失败,这使得在有限测试预算下的真实故障发现变得困难。虽然可以通过模拟器、低保真系统或相关策略进行广泛采样来寻找故障,但代理故障往往无法有效转移到真实世界。本文提出了一种自适应故障发现方法,结合代理评估与有限目标系统结果,以指导目标系统测试的场景选择。该方法通过控制变量启发的残差建模来校正代理故障信号,从而学习目标风险的局部预测器。为发现既可能又多样的故障,我们结合了支持感知的互信息目标,偏向于现实且支持良好的区域,同时扩展故障模式的覆盖范围。实验结果表明,该方法在自主驾驶、操作和四足动物速度跟踪任务中发现的故障数量是随机采样和主动学习基线的两倍,包括竞争方法遗漏的严重且多样的故障。
🔬 方法详解
问题定义:本文旨在解决自主系统故障发现中的挑战,尤其是在有限测试预算下,现有方法难以有效利用代理系统信息进行准确的故障预测。
核心思路:提出了一种自适应故障发现方法,通过结合代理评估与有限目标系统结果,利用控制变量启发的残差建模来校正代理信号,从而提高目标风险的预测能力。
技术框架:整体架构包括代理系统评估、目标系统测试和故障预测三个主要模块。首先,通过代理系统进行广泛的故障评估,然后利用有限的目标系统结果进行校正,最后生成故障预测以指导后续测试。
关键创新:最重要的创新在于结合了支持感知的互信息目标,使得故障发现不仅关注可能性,还关注多样性,从而扩展了故障模式的覆盖范围。与现有方法相比,该方法更有效地利用了代理信息。
关键设计:在参数设置上,采用了控制变量方法来校正代理信号,损失函数设计上强调了对多样性和覆盖率的平衡,网络结构则基于现有的深度学习框架进行优化,以适应不同任务的需求。
🖼️ 关键图片
📊 实验亮点
实验结果显示,提出的方法在自主驾驶、操作和四足动物速度跟踪任务中,发现的故障数量是随机采样和主动学习基线的两倍,尤其是在严重和多样的故障方面,展现了显著的性能提升。
🎯 应用场景
该研究的潜在应用领域包括自主驾驶、机器人操作和其他需要高可靠性的自主系统。通过有效发现系统故障,可以显著提高系统的安全性和可靠性,降低实际应用中的风险,具有重要的实际价值和未来影响。
📄 摘要(原文)
Autonomous systems can fail in rare and heterogeneous ways, making real-world failure discovery difficult under limited testing budgets. Although cheaper proxies such as simulators, lower-fidelity systems, or related policies can be sampled extensively to find failures, proxy failures often do not transfer to the real world due to sim-to-real and system-to-system gaps. The key challenge is therefore to effectively leverage proxy system information for accurate prediction of severe target system failures. We propose an adaptive failure discovery method that combines proxy evaluations with limited target system results to guide scenario selection for target system testing. Our method learns a local predictor of target risk by correcting proxy failure signals using control-variate-inspired residual modeling. To find failures that are both likely and diverse, we combine this predictor with a support-aware mutual-information objective that favors realistic, well-supported regions while expanding coverage across failure modes. Across autonomous driving, manipulation, and quadruped velocity-tracking tasks, our method discovers up to 2$\times$ as many failures as random sampling and active-learning baselines, including severe and diverse failures missed by competing methods.