SPADE: Speculative Decoding for Precise and Low Cost Distributed Edge Cloud Inference
作者: Divya Jyoti Bajpai, Kishan Kumar Upadhyay, Manjesh Kumar Hanawal
分类: cs.AI
发布日期: 2026-08-13
💡 一句话要点
提出SPADE框架以解决边缘云推理的高成本与低精度问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 边缘计算 云推理 推测解码 大型语言模型 自然语言处理 计算效率 模型验证
📋 核心要点
- 现有方法在边缘部署小型LLMs时准确性下降,而云端大型LLMs则面临高昂的计算成本。
- SPADE框架通过在边缘生成候选标记并在云端进行验证,减少了云端计算负担,提升了推理效率。
- 实验结果显示,SPADE在多个任务中将云模型调用减少了76%,且保持了与全模型相同的准确性。
📝 摘要(中文)
大型语言模型(LLMs)在自然语言理解和生成方面取得了显著成功,但其部署受到高计算需求的限制。直接在边缘部署较小的LLMs可以规避这一问题,但会导致准确性下降。本文提出了一种分布式推理框架SPADE,结合了边缘和云的推测解码(SD)。在边缘部署的紧凑草稿模型快速生成候选标记,而云端的大型验证模型并行验证这些标记。接受的标记被保留,只有拒绝的标记才触发验证器的修正,从而显著减少云查询次数。实验结果表明,SPADE在多个自然语言处理任务中将云模型调用减少了76%,且准确性没有损失。
🔬 方法详解
问题定义:本文旨在解决大型语言模型在边缘和云端推理中的高计算成本与低准确性问题。现有方法在边缘部署小型模型时,准确性往往无法满足需求,而云端大型模型则面临高昂的每个标记计算费用。
核心思路:SPADE框架的核心思路是结合边缘和云的推测解码,通过在边缘快速生成候选标记,并在云端进行并行验证,从而降低云端计算负担。此设计旨在保持准确性同时降低推理时间和成本。
技术框架:SPADE框架主要包括两个模块:边缘的草稿模型和云端的验证模型。草稿模型负责快速生成候选标记,而验证模型则对这些标记进行并行验证,只有被拒绝的标记才会触发进一步的验证过程。
关键创新:SPADE的创新在于其将推测解码与分布式推理相结合,显著减少了云端模型的调用次数,且无需对模型进行重新训练。与传统方法相比,SPADE在保持准确性的同时,显著降低了计算成本。
关键设计:在设计中,草稿模型采用了紧凑的网络结构,以快速生成候选标记,而验证模型则是一个大型的预训练模型,负责对候选标记进行准确性验证。该设计确保了在边缘和云端的计算负担合理分配。
🖼️ 关键图片
📊 实验亮点
实验结果表明,SPADE在多个自然语言处理任务中表现优异,相较于完整模型,其云模型调用减少了76%,且准确性保持不变。这一显著的性能提升展示了SPADE在实际应用中的有效性和可行性。
🎯 应用场景
SPADE框架在自然语言处理领域具有广泛的应用潜力,尤其适用于需要实时推理的场景,如智能助手、聊天机器人和在线翻译服务。其高效的推理能力和低成本特性使其在实际部署中具备显著的价值,能够推动大型语言模型在边缘计算环境中的应用。未来,SPADE可能会影响更多领域的智能应用,提升用户体验。
📄 摘要(原文)
Large Language Models (LLMs) have achieved remarkable success in natural language understanding and generation, but their deployment is constrained by high computational demands. Deploying smaller LLMs directly on the edge can circumvent this, but with degraded accuracy. Deploying smaller cloud-based big LLMs preserves performance, but at the cost of expensive per-token computation. We present a distributed inference framework, \our{}, that integrates speculative decoding (SD) across edge and cloud. A compact draft model deployed on the edge generates candidate tokens rapidly, and a large verifier model on the cloud validates these tokens in parallel. Accepted tokens are retained, while only rejections trigger verifier correction, substantially reducing the number of cloud queries. Our plug-and-play design shifts the bulk of computation to the edge, significantly lowers inference time and cloud cost, and preserves the accuracy of the big model without any retraining requirement. Our approach demonstrates a practical path toward scalable, cost-efficient, and accurate deployment of LLMs in real-world environments. Experimental results across multiple Natural Language Processing tasks using SpecBench and CNN/Dailymail datasets demonstrate that \our{} reduces the cloud model calls by $76\%$ with zero loss in accuracy as compared to the full model.