Behavior-Skill: A Fine-Grained Benchmark for Evaluating Vision-Language-Action Policies in Long-Horizon Tasks
作者: Chunyun Ma, Lun Luo, Xingjian Luo, Xiexing Feng, Hang Zhang, Wei Liu, Feng Qiao, Yaonan Wang, Huimin Lu, Xieyuanli Chen
分类: cs.RO
发布日期: 2026-08-31
🔗 代码/项目: GITHUB
💡 一句话要点
提出Behavior-Skill基准以解决长时间任务评估中的技能分析问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 长时间任务 技能评估 移动操作 行为基准 多模态学习 机器人技术 策略优化
📋 核心要点
- 现有的评估方法主要依赖于全任务的汇总指标,难以观察和分析中间失败,限制了对技能的深入理解。
- 本文提出Behavior-Skill基准,通过将长时间任务的学习和评估围绕可执行的组成技能进行重构,提供了更细粒度的评估。
- 实验结果显示,技能间的失败分布不均,特别是接触丰富的操作技能存在显著瓶颈,强调了该基准的实用性和必要性。
📝 摘要(中文)
长时间移动操作任务的可靠执行仍然面临挑战,因为整体任务成功依赖于多个组成技能的成功完成。然而,现有基准主要依赖于全任务的回放和汇总的任务级指标,使得中间失败难以观察和分析。本文提出Behavior-Skill基准,围绕可执行的组成技能重新构建长时间任务的学习和评估。该基准包含来自10,000个演示的235,492个技能实例,涵盖50个家庭任务和34个语义技能类别。每个实例将技能指令与对齐的观察-动作段配对,并进一步关联可恢复的中间状态和技能成功条件,以便在有效前提下进行独立评估。我们还引入了轨迹级和技能级指标,以超越汇总任务成功来表征策略能力。大量实验表明,失败在技能间高度不均匀,接触丰富的操作技能形成持久瓶颈。
🔬 方法详解
问题定义:本文旨在解决长时间移动操作任务评估中的技能分析不足问题。现有方法主要依赖于全任务的汇总指标,无法有效识别和分析中间失败,导致对技能的理解不够深入。
核心思路:论文的核心思路是通过Behavior-Skill基准,将长时间任务的学习和评估围绕可执行的组成技能进行重构。这种设计使得每个技能的执行情况可以独立评估,从而更好地识别和分析技能的成功与失败。
技术框架:整体架构包括数据收集、技能实例构建、评估指标设计等多个模块。具体而言,基准包含235,492个技能实例,每个实例都与技能指令、观察-动作段及中间状态相关联。
关键创新:最重要的技术创新点在于引入了轨迹级和技能级的评估指标,使得策略能力的表征超越了传统的汇总任务成功率。这一创新使得研究者能够更细致地分析和改进长时间任务中的策略。
关键设计:在关键设计方面,论文详细描述了技能实例的构建过程,包括技能指令与观察-动作段的对齐,以及中间状态和成功条件的定义。这些设计确保了评估的有效性和独立性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,Behavior-Skill基准能够有效揭示技能间的失败分布,尤其是接触丰富的操作技能存在显著瓶颈。与现有方法相比,Behavior-Skill提供了更深入的能力分析,帮助识别和改进策略的具体弱点。
🎯 应用场景
该研究的潜在应用领域包括家庭机器人、服务机器人以及其他需要长时间任务执行的自动化系统。通过提供更细粒度的技能评估,Behavior-Skill基准能够帮助研究者和工程师更好地理解和优化机器人在复杂环境中的表现,推动智能机器人技术的发展。
📄 摘要(原文)
Reliable execution of long-horizon mobile manipulation tasks remains challenging because overall task success depends on the successful completion of multiple constituent skills. Existing benchmarks, however, still rely primarily on full-task rollouts and aggregate task-level metrics, making intermediate failures difficult to observe and analyze. We present Behavior-Skill, a benchmark that reformulates the learning and evaluation of long-horizon tasks around executable constituent skills. It contains 235,492 skill instances from 10,000 demonstrations across 50 household tasks and 34 semantic skill categories. Each instance pairs a skill instruction with an aligned observation-action segment, and is further associated with a restorable intermediate state and a skill success condition to enable independent evaluation under valid preconditions. We further introduce trajectory-level and skill-level metrics to characterize policy capability beyond aggregate task success. Extensive experiments across representative VLA policies including pi0.5 and GR00T on the complete 50-task benchmark show that failures are highly non-uniform across skills, with contact-rich manipulation skills forming persistent bottlenecks. These results demonstrate that Behavior-Skill complements full-task evaluation by exposing intermediate capability profiles for analyzing and improving long-horizon VLA policies. Behavior-Skill is publicly available at https://github.com/nubot-nudt/Behavior-Skill.