FailBench: How Reliable are VLMs at Judging Robot Task Success?
作者: Zaruhi Navasardyan, Tatul Danielyan, Hrant Davtyan
分类: cs.RO, cs.AI
发布日期: 2026-09-03
💡 一句话要点
提出FailBench基准以评估视觉语言模型在机器人任务成功判断中的可靠性
🎯 匹配领域: 支柱一:机器人控制 (Robot Control)
关键词: 视觉语言模型 机器人任务 失败检测 基准测试 跨领域泛化 性能评估 输入级干预
📋 核心要点
- 现有的视觉语言模型在机器人任务成功判断中的泛化能力不足,缺乏有效的基准测试。
- 论文提出了FailBench基准,通过2197次操作尝试来系统评估机器人失败检测的能力。
- 实验结果显示,最佳模型的平均平衡准确率仅为0.77,且通过输入级干预可提升检测性能。
📝 摘要(中文)
视觉语言模型(VLMs)在评估机器人操作结果中越来越受到重视,但现有基准对跨领域泛化的证据有限。我们提出了FailBench,这是一个包含2197次操作尝试的机器人失败检测基准,涵盖14个公共来源(12个真实世界,2个模拟)。在FailBench中,75%的失败是自然发生的,六个真实世界来源来自非失败检测数据集。对13个基于VLM的检测器进行评估,发现最佳模型的平均平衡准确率仅为0.77。值得注意的是,针对失败检测进行微调的模型表现始终低于通用VLM及其预训练基线。性能严重依赖于所需的视觉证据:当结果依赖于可观察的物体运动时,模型接近饱和,但在接触密集的组装任务中准确率降至近乎随机(<0.60)。错误分析揭示了在模糊证据下预测成功的系统性偏差,即使在增加推理努力的情况下也依然存在。最后,我们展示了输入级干预——空间定位和裁剪结果相关区域——在不额外训练的情况下将最佳检测器的性能提高了2.4个百分点。
🔬 方法详解
问题定义:本论文旨在解决视觉语言模型在机器人任务成功判断中的可靠性问题,现有方法在跨领域泛化方面存在显著不足,无法有效识别机器人操作中的失败情况。
核心思路:提出FailBench基准,系统性地收集和评估机器人操作失败的实例,以便更好地测试和比较不同视觉语言模型的性能。通过引入自然发生的失败案例,增强模型的训练和评估数据的多样性。
技术框架:FailBench基准包含2197次操作尝试,数据来源于12个真实世界和2个模拟环境。评估过程中,使用13个基于VLM的检测器进行比较,分析其在不同任务中的表现。
关键创新:最重要的创新在于引入了FailBench这一新基准,特别关注自然发生的失败案例,并揭示了模型在处理模糊证据时的系统性偏差。与现有方法相比,FailBench提供了更全面的评估标准。
关键设计:在实验中,模型的微调策略和输入级干预设计是关键,特别是通过空间定位和裁剪结果相关区域,显著提升了检测器的性能。
🖼️ 关键图片
📊 实验亮点
实验结果显示,最佳模型的平均平衡准确率仅为0.77,且在接触密集的组装任务中准确率降至近乎随机(<0.60)。通过输入级干预,检测器的性能提高了2.4个百分点,展示了该方法的有效性。
🎯 应用场景
该研究的潜在应用领域包括机器人操作的自动评估、智能制造和人机协作等。通过提高视觉语言模型在失败检测中的可靠性,能够更好地支持机器人在复杂环境中的自主决策,提升其在实际应用中的有效性和安全性。
📄 摘要(原文)
Vision-Language Models (VLMs) are increasingly used to evaluate robot manipulation outcomes, but existing benchmarks offer limited evidence of cross-domain generalization. We introduce FailBench, a benchmark for robot failure detection comprising 2,197 manipulation attempts across 14 public sources (12 real-world, 2 simulated). In FailBench, 75% of failures occur naturally, and six real-world sources come from non-failure-detection datasets. Evaluating 13 VLM-based detectors, we find the best model achieves only 0.77 mean balanced accuracy. Notably, models fine-tuned for failure detection consistently underperform general-purpose VLMs and their own pretrained baselines. Performance depends heavily on required visual evidence: models approach saturation when outcomes depend on observable object motion, but degrade to near-chance (<0.60 balanced accuracy) on contact-intensive assembly tasks. Error analysis reveals a systematic bias toward predicting success under ambiguous evidence, which persists even with increased reasoning effort. Finally, we show that input-level intervention--spatially localizing and cropping outcome-relevant regions--improves the top detector by 2.4 percentage points without extra training.