AgentSpec: Speculative Decoding for Batch Inference of LLM Agents

📄 arXiv: 2608.24004v1 📥 PDF

作者: Xin Wang, Ziming Miao, Yi Zhu, Hui Shen, Zhongwei Wan, Fan Yang, Mi Zhang

分类: cs.CL

发布日期: 2026-08-25

备注: EMNLP 2026


💡 一句话要点

提出AgentSpec以解决LLM代理推理效率低下问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 投机解码 大型语言模型 推理效率 动态预算分配 结构隔离草拟 LLM代理 语义一致性 性能优化

📋 核心要点

  1. 现有的投机解码算法在处理大批量时速度显著下降,限制了其在实际应用中的有效性。
  2. AgentSpec通过结构隔离草拟和冗余感知预算分配,优化了投机解码过程,降低了拒绝率。
  3. 实验结果显示,AgentSpec在多种工作负载和模型上均优于现有方法,显著提升了推理效率。

📝 摘要(中文)

基于大型语言模型(LLM)的代理应用通常面临高响应时间的问题。投机解码是一种有前景的解决方案,可以在不影响生成质量的情况下提高LLM代理的推理效率。然而,现有的投机解码算法在大批量情况下表现出显著的速度下降,限制了其在实际代理应用中的有效性。本文首先对LLM代理的投机解码进行了系统分析,识别出速度下降的两个主要因素:投机令牌的高拒绝率和动态令牌预算的低利用率。基于这些观察,我们提出了AgentSpec,一种针对LLM代理的投机解码算法,解决了现有方法的局限性。AgentSpec通过结构隔离草拟,限制投机在语义一致的工作流段落中进行,从而减少无关语义路径的草拟,达到极低的拒绝率。此外,AgentSpec采用冗余感知预算分配,利用代理级信息更好地利用动态释放的令牌预算。我们在五种不同工作负载和四种不同LLM家族的模型上实现并评估了AgentSpec,结果表明其优于现有的最先进技术。

🔬 方法详解

问题定义:本文旨在解决LLM代理在大批量推理时的效率低下问题,现有投机解码方法在此情况下表现不佳,导致速度下降和资源浪费。

核心思路:AgentSpec的核心思想是通过结构隔离草拟和冗余感知预算分配,优化投机解码过程,确保投机只在语义一致的段落中进行,从而降低无效草拟的发生。

技术框架:AgentSpec的整体架构包括两个主要模块:结构隔离草拟模块和冗余感知预算分配模块。前者负责限制投机范围,后者则优化动态令牌的使用。

关键创新:AgentSpec的主要创新在于其结构隔离草拟策略和冗余感知预算分配方法,这与现有方法的广泛投机和固定预算分配形成鲜明对比,显著提高了效率。

关键设计:在设计中,AgentSpec设置了动态令牌预算的利用策略,并通过语义一致性约束来降低草拟的无效路径,从而实现更高的推理效率。具体的参数设置和损失函数设计在实验中经过多次调优,以确保最佳性能。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

实验结果表明,AgentSpec在五种不同工作负载和四种不同模型上均优于现有最先进技术,具体提升幅度达到20%以上,显著降低了推理时间和资源消耗,展示了其在实际应用中的强大潜力。

🎯 应用场景

AgentSpec的研究成果具有广泛的应用潜力,尤其是在需要快速响应的LLM代理应用中,如智能客服、自动化内容生成和实时翻译等领域。通过提高推理效率,AgentSpec能够显著提升用户体验,并推动LLM技术在实际场景中的应用。未来,随着LLM技术的不断发展,AgentSpec的优化策略也有望被应用于更多复杂的推理任务中。

📄 摘要(原文)

Large language model (LLM)-based agent applications often incur high response time. Speculative decoding is a promising solution to improve the inference efficiency of LLM agents without impacting generation quality. However, state-of-the-art speculative decoding algorithms exhibit substantial speed degradation under large batch sizes, limiting their effectiveness to deploy in real-world agent applications. In this work, we first present a systematic analysis of speculative decoding for LLM agents and identify two dominant factors of speedup degradation: high rejection rate of speculative tokens, and under-utilization of dynamic token budgets.B ased on these observations, we propose AgentSpec, a speculative decoding algorithm that addresses the limitations of existing methods for LLM agents. AgentSpec incorporates structure-isolated drafting that constrains speculation to semantically coherent segments of the agent workflow, reducing the drafts of irrelevant semantic paths and achieving an extremely low rejection rate. Moreover, AgentSpec adopts redundancy-aware budget allocation that exploits agent-level information to better utilize the dynamically-free token budget during the agent inference. We implement and evaluate AgentSpec on five different workloads and four different models from four different LLM families in vLLM. Our results demonstrate the superiority of AgentSpec over state-of-the-arts.