MemSpec: Memory-Aware Runtime for Adaptive Draft Scheduling in Speculative Decoding on Edge Devices

📄 arXiv: 2608.10362v1 📥 PDF

作者: Eunjeong Kim, Yeong Jun Jeon, Myeonggyun Han

分类: cs.OS, cs.AI

发布日期: 2026-08-11

备注: Published in LCTES 2026

期刊: Proc. ACM LCTES 2026, 180-192 (2026)

DOI: 10.1145/3814943.3816174


💡 一句话要点

提出MemSpec以解决边缘设备上自适应草稿调度问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 自适应推测解码 边缘设备 内存感知调度 轻量级模型 生成吞吐量提升

📋 核心要点

  1. 现有的自适应推测解码方法在内存受限的边缘设备上,因草稿选择与可用性不匹配而未能有效提升吞吐量。
  2. MemSpec通过预测引导和内存感知的运行时管理,主动管理草稿选择与执行,降低了模型切换的开销。
  3. 在Jetson Orin Nano上的实验表明,MemSpec的生成吞吐量平均提升了40.7%,显著优于现有的自适应方法。

📝 摘要(中文)

论文提出了一种名为MemSpec的内存感知运行时,旨在解决边缘设备上自适应推测解码中的草稿选择与可用性不匹配的问题。推测解码通过使用轻量级草稿模型来加速自回归大型语言模型的推理,但在内存受限的环境中,现有方法常因切换草稿模型的开销而未能提升整体吞吐量。MemSpec通过主动管理工作集,解耦草稿选择与执行,利用轻量级预测器评估草稿的有效性,并通过内存感知调度器减少模型加载的反应性开销。实验结果表明,MemSpec在Jetson Orin Nano上平均提升了40.7%的生成吞吐量,接近理论上限。

🔬 方法详解

问题定义:论文要解决的问题是边缘设备上自适应推测解码中草稿选择与可用性不匹配的挑战。现有方法在内存受限的情况下,因频繁切换草稿模型而导致吞吐量未能有效提升。

核心思路:MemSpec的核心思路是通过预测引导和内存感知的调度策略,解耦草稿选择与执行,从而优化内存使用和提升生成效率。这样的设计旨在减少模型切换的开销,提升整体性能。

技术框架:MemSpec的整体架构包括两个主要模块:轻量级预测器和内存感知调度器。预测器根据输入提示和生成上下文评估草稿的有效性,而调度器则负责管理模型的加载和执行,确保在内存限制下的高效运行。

关键创新:MemSpec的关键创新在于其内存感知的调度策略和预测引导的草稿选择机制。这与现有的基于带子的方法本质上不同,后者往往依赖于反应式的模型切换,而MemSpec则通过主动管理来提高效率。

关键设计:在设计中,MemSpec采用了轻量级的预测器来实时评估草稿的有效性,并通过内存感知的调度算法来优化模型的加载时机和顺序,确保在内存受限的情况下仍能实现高效的推理过程。具体的参数设置和损失函数设计尚未详细披露。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,MemSpec在Jetson Orin Nano平台上,平均提升了40.7%的生成吞吐量,相较于最先进的基于带子的方法表现出显著的优势,且接近理论上的最佳性能界限。这一成果验证了MemSpec在内存受限环境下的有效性和实用性。

🎯 应用场景

MemSpec的研究成果在边缘计算、物联网设备和移动端人工智能应用中具有广泛的潜在应用价值。通过提升推测解码的效率,能够在资源受限的环境中实现更快速的自然语言处理和智能交互,推动智能设备的普及与应用。未来,MemSpec的技术也可能扩展到其他需要高效推理的领域,如实时视频分析和智能监控等。

📄 摘要(原文)

Speculative decoding accelerates autoregressive large language model (LLM) inference by using a lightweight draft model to speculate multiple tokens, reducing expensive target model decoding steps. Its effectiveness depends heavily on draft selection, motivating adaptive methods that exploit variation across inputs and generation stages. On memory-constrained edge devices, however, these methods often fail to improve end-to-end throughput due to the overhead of switching between draft models. We identify a key limitation in this setting: the mismatch between draft selection and draft availability under tight memory budgets. To address this challenge, we present MemSpec, a prediction-guided, memory-aware runtime for adaptive speculative decoding on edge devices. MemSpec decouples draft selection from execution through proactive resident working-set management. A lightweight predictor estimates draft effectiveness from prompt and generation context, while a memory-aware scheduler reduces reactive model loading overhead. Experiments on a Jetson Orin Nano show that MemSpec improves steady-state generation throughput by 40.7% on average over state-of-the-art bandit-based adaptive methods while closely approaching the oracle upper bound.