CoCoBench: A Cooperative Coordination Benchmark for Embodied Multi-Agent Task Planning
作者: Yang Chen, Ye-Xin Xie, Lirong Che, Danyang Peng, Yuzhe Yang, Peiwen Lin, Xu Cao, Chuang Wang, Lei Yuan, Jian Su, Lan-Zhe Guo
分类: cs.RO
发布日期: 2026-08-28
💡 一句话要点
提出CoCoBench以解决多智能体协调评估不足的问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多智能体协调 基准测试 任务分配 顺序安排 交接协调 多模态语言模型 智能体系统 家庭自动化
📋 核心要点
- 现有的多智能体基准测试缺乏对协调能力的细致评估,容易忽视协调失败的情况。
- CoCoBench通过构建级评估框架,提供了针对多智能体协调的细致评分,涵盖任务分配等四个方面。
- 实验结果显示,协调能力在不同构建类型上表现不均,提示未来模型架构设计的新方向。
📝 摘要(中文)
近年来,由多模态大型语言模型驱动的智能体系统发展迅速,但现有的智能体基准测试在多智能体协调方面仍缺乏细致的诊断。大多数基准测试要么专注于单智能体任务完成,要么通过整体任务成功率来总结多智能体行为,这可能掩盖协调失败,如重复工作、顺序约束违反、资源竞争和不同步交接。本文提出了CoCoBench,这是一个用于评估可执行家庭任务中多智能体协调的构建级基准。CoCoBench包含897个经过oracle验证的实例,围绕四个常见的协调构建组织:任务分配、顺序安排、互斥和交接协调。除了任务成功率外,CoCoBench还提供构建级评分,以衡量智能体的协调有效性。我们评估了11种领先的多模态大型语言模型,结果表明协调能力高度依赖于构建类型,整体强劲表现并不意味着在不同协调类型上的能力均衡。
🔬 方法详解
问题定义:本文旨在解决现有多智能体基准测试在协调能力评估方面的不足,现有方法往往忽视了协调失败的细节,如重复工作和资源竞争等问题。
核心思路:CoCoBench通过构建级评估框架,提供了针对多智能体协调的细致评分,能够更好地反映智能体在任务执行中的协调效果。
技术框架:CoCoBench包含897个经过oracle验证的实例,围绕任务分配、顺序安排、互斥和交接协调四个主要模块进行组织,提供构建级评分和任务成功率的双重评估。
关键创新:最重要的创新在于引入了构建级评分机制,使得评估不仅仅依赖于任务成功率,而是能够细致地分析智能体的协调能力。
关键设计:在设计中,采用了多种协调模式和观察输入,评估了11种领先的多模态大型语言模型,确保了评估的全面性和准确性。实验结果表明,协调能力在不同构建类型上表现不均,提示未来模型架构设计的新方向。
🖼️ 关键图片
📊 实验亮点
实验结果显示,11种多模态大型语言模型在不同协调模式下的表现差异显著,整体任务成功率高并不代表在所有协调类型上均衡能力。具体而言,某些模型在任务分配上表现优异,而在交接协调方面则存在明显不足,提示未来研究需针对性改进。
🎯 应用场景
CoCoBench的研究成果可广泛应用于多智能体系统的开发与评估,尤其是在家庭自动化、机器人协作和智能交通等领域。通过提供细致的协调能力评估,研究者和工程师能够更好地优化智能体的设计,提高其在复杂环境中的协作效率,推动智能体技术的实际应用和发展。
📄 摘要(原文)
Agent systems powered by multimodal large language models (MLLMs) have advanced rapidly in recent years, yet existing embodied-agent benchmarks still lack fine-grained diagnostics for multi-agent coordination. Most benchmarks either focus on single-agent task completion or summarize multi-agent behavior with overall task success rates, which can obscure coordination failures such as duplicated work, violations of ordering constraints, resource contention, and desynchronized handoffs. In this paper, we introduce CoCoBench, a construct-level benchmark for evaluating multi-agent embodied coordination in executable household tasks. CoCoBench contains 897 oracle-validated instances organized around four recurring coordination constructs: task allocation, sequential ordering, mutual exclusion, and handoff coordination. In addition to task success rate, CoCoBench provides construct-level scores that measure whether agents coordinate effectively. We evaluate 11 leading MLLMs across different coordination modes, observation inputs, and numbers of agents. The results show that coordination ability is highly construct-specific: strong overall performance does not imply balanced competence across different coordination types. These findings point to new directions for designing targeted model architectures and improving multi-agent coordination ability.