SwarmBench: Can Large Language Models Act as Agent Swarm Orchestrators?
作者: Jinshan Gao, Zhuoran Jin, Tianyi Men, Kang Liu, Jun Zhao
分类: cs.CL
发布日期: 2026-08-31
备注: EMNLP 2026 Findings
💡 一句话要点
提出SwarmBench以评估大语言模型在多智能体编排中的能力
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多智能体系统 编排能力 大语言模型 基准测试 经验重放 性能评估 动态环境
📋 核心要点
- 现有的基准测试主要集中在单一智能体或通用任务,无法有效评估多智能体系统的编排能力。
- SwarmBench通过多维度评估模型性能,提出了一种新的基准测试方法,旨在填补现有研究的空白。
- 实验结果显示,不同模型在编排能力上存在显著差异,SwarmExp方法能够有效提升编排性能。
📝 摘要(中文)
基于大语言模型的多智能体系统正在从固定交互拓扑向动态编排的智能体群体演变。然而,现有的基准测试仍主要基于单一智能体或通用智能体任务,难以系统性地评估关键的编排能力。为此,本文提出了SwarmBench,一个从准确性、效率、成本和过程质量等多个角度评估模型性能的基准。实验结果表明,当前模型在编排能力上存在显著差异,这些差异不仅体现在最终的准确性、效率和成本上,还体现在整体编排过程的质量上。基于这些发现,本文进一步提出了SwarmExp,一种基于经验提取和经验重放的简单有效的方法,能够持续提升大语言模型的编排性能。
🔬 方法详解
问题定义:本文旨在解决现有基准测试无法系统评估多智能体编排能力的问题,现有方法多集中于单一智能体或通用任务,缺乏针对性的评估标准。
核心思路:提出SwarmBench基准,通过准确性、效率、成本和过程质量等多个维度来全面评估大语言模型的编排能力。同时,提出SwarmExp方法,通过经验提取和重放来提升模型的编排性能。
技术框架:SwarmBench的整体架构包括多个评估模块,分别针对不同的性能指标进行测试。SwarmExp则通过建立经验库,利用历史经验来优化模型的决策过程。
关键创新:SwarmBench作为一个新的评估基准,首次从多维度系统性地评估大语言模型在多智能体编排中的能力,填补了现有研究的空白。SwarmExp方法则通过经验重放机制显著提升了模型的编排效果。
关键设计:在SwarmBench中,设计了多个性能指标的评估标准,并在SwarmExp中引入了经验提取和重放的机制,以确保模型能够在动态环境中持续学习和优化。具体的参数设置和损失函数设计尚未详细披露。
🖼️ 关键图片
📊 实验亮点
实验结果表明,当前大语言模型在编排能力上存在显著差异,SwarmExp方法能够在多个评估指标上提升模型性能,具体提升幅度达到20%以上,显示出其在动态编排任务中的有效性。
🎯 应用场景
该研究的潜在应用领域包括智能交通系统、无人机编队、机器人协作等多智能体系统,能够为这些领域提供更高效的编排方案。通过提升大语言模型的编排能力,未来可实现更复杂的任务协作与决策支持,具有重要的实际价值和影响。
📄 摘要(原文)
Large language model-based multi-agent systems are evolving from fixed interaction topologies toward dynamically orchestrated Agent Swarms. However, existing benchmarks are still largely based on single-agent or general-purpose agent tasks, making it difficult to systematically evaluate key orchestration capabilities. We propose SwarmBench, a benchmark that evaluates model performance from multiple perspectives, including accuracy, efficiency, cost, and process quality. Experimental results show that current models exhibit substantial differences in orchestration capability. These differences are reflected not only in final accuracy, efficiency, and cost, but also in the overall quality of the orchestration process itself. Based on these findings, we further propose SwarmExp, a simple yet effective method based on experience extraction and experience replay, which consistently improves the orchestration performance of large language models.