OUTLETS: Output-Length Prediction from Speculative Decoding Backbones
作者: Weihuang Wen, Yingying Liu, Yichuan Liu, Wenqi Zeng, Li Zhou, Chumin Sun, Jie Sun, Tianshu Yu
分类: cs.CL
发布日期: 2026-09-01
备注: Accepted to EMNLP 2026
💡 一句话要点
提出OUTLETS以解决大语言模型输出长度预测问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 输出长度预测 推测解码 大语言模型 资源调度 机器学习
📋 核心要点
- 现有的输出长度预测方法存在延迟高和精度低的问题,影响了资源配置和调度效率。
- OUTLETS通过利用推测解码中的潜在表示,构建了一种轻量的长度预测模型,提升了预测精度。
- 实验结果表明,OUTLETS在短请求的P99延迟上降低了34.8%,显著优化了调度性能。
📝 摘要(中文)
大语言模型(LLM)在服务时输出长度的重尾分布给资源配置和集群调度带来了重大挑战。尽管输出长度预测可以缓解这些问题,但现有方法存在关键缺陷:外部代理模型增加了显著的延迟且通常精度有限,而基于内部状态的方法虽然高效,但依赖于对当前模型状态的浅层探测。我们发现了推测解码(SD)与长度预测之间的结构性联系:先进框架(如EAGLE-3)中的草稿解码器生成的潜在表示编码了可预测生成长度的信号。基于这一洞察,我们提出了OUTLETS(基于推测解码骨干的输出长度预测),它将推测骨干重新用于轨迹感知的长度预测。OUTLETS在已计算的草稿表示上仅增加了轻量回归头,且其均方误差(MAE)低于评估的方法。在饱和的分散服务下,OUTLETS的预测使标准调度策略能够优先处理较短请求,并更均匀地分配请求,从而将短请求的P99延迟降低了34.8%。
🔬 方法详解
问题定义:本论文旨在解决大语言模型输出长度预测的挑战,现有方法如外部代理模型导致延迟增加,内部状态方法则依赖于浅层探测,精度不足。
核心思路:论文提出OUTLETS,通过推测解码生成的潜在表示来进行长度预测,利用已计算的草稿表示,增加轻量回归头,避免了额外的延迟。
技术框架:OUTLETS的整体架构包括推测解码器和回归头两个主要模块。推测解码器负责生成潜在表示,而回归头则用于根据这些表示进行长度预测。
关键创新:OUTLETS的核心创新在于将推测解码的潜在表示用于长度预测,这一方法与传统的外部代理模型和内部状态方法有本质区别,显著提高了预测的效率和准确性。
关键设计:OUTLETS的设计包括轻量回归头的构建,损失函数采用均方误差(MAE),并在推测解码过程中利用已生成的草稿表示,确保了模型的高效性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,OUTLETS在短请求的P99延迟上降低了34.8%,相较于其他评估方法,其均方误差(MAE)表现更优。这一成果表明OUTLETS在资源调度中的有效性,能够更好地满足实际应用需求。
🎯 应用场景
该研究的潜在应用领域包括大语言模型的资源调度和优化,尤其在需要高效处理大量请求的场景中,如在线客服、智能助手等。通过提高输出长度预测的准确性,能够显著提升系统的响应速度和用户体验,具有重要的实际价值和未来影响。
📄 摘要(原文)
The heavy-tailed distribution of output lengths in Large Language Model (LLM) serving poses major challenges for resource provisioning and cluster scheduling. Although output-length prediction can mitigate these issues, existing approaches have key drawbacks: external proxy models add substantial latency and often have limited fidelity, whereas internal state-based methods are efficient but rely on shallow probes of current model states. We identify a structural connection between speculative decoding (SD) and length prediction: latent representations produced by the draft decoder in advanced frameworks (e.g., EAGLE-3) encode signals that are predictive of generation length. Building on this insight, we introduce OUTLETS (Output-Length Prediction from Speculative Decoding Backbones), which repurposes the speculative backbone as a trajectory-aware length predictor. When its draft representations are already computed for speculative decoding, OUTLETS adds only a lightweight regression head and achieves lower MAE than the evaluated methods. Under saturated disaggregated serving, OUTLETS predictions enable standard scheduling policies to prioritize shorter requests and distribute requests more evenly across decoding instances, reducing short-request P99 latency by 34.8%.