SGD-KV: Summarization Guided KV Cache Compression

📄 arXiv: 2609.03235v1 📥 PDF

作者: Zeyu Liu, Woomin Song, Xuandi Fu, Sai Muralidhar Jayanthi, Vivek Govindan, Aram Galstyan, Sravan Babu Bodapati, Srikanth Ronanki

分类: cs.CL

发布日期: 2026-09-03

备注: Accepted in NeurIPS2026 Efficient Reasoning Workshop


💡 一句话要点

提出SGD-KV以解决长上下文推理中的KV缓存压缩问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 长上下文推理 KV缓存压缩 注意力机制 信息聚合 内存优化

📋 核心要点

  1. 现有的KV缓存压缩技术未能充分利用不同注意力头的功能,导致内存使用效率低下。
  2. SGD-KV通过引入块摘要诊断任务,识别并优先考虑在信息聚合中表现突出的注意力头。
  3. 实验结果显示,SGD-KV在长上下文推理中性能优越,内存使用显著降低,提升幅度达到75%。

📝 摘要(中文)

大型语言模型(LLMs)在长上下文推理中面临严重的内存瓶颈,主要由于键值(KV)缓存的线性增长。现有的KV缓存压缩技术通常依赖简单的启发式方法,忽视了不同注意力头的功能角色。本文提出了SGD-KV(摘要引导的KV缓存压缩),这是一个关注头的框架,利用一种新的块摘要诊断任务,系统性地识别和优先考虑专注于层次信息聚合的注意力头。在Qwen2.5-7B-1M和Qwen3-32B的多种长上下文基准测试中,SGD-KV在上下文长度达到1M时实现了最先进的性能,同时将KV缓存内存使用减少了多达75%。我们的研究表明,基于注意力头的摘要评分分布战略性地分配KV缓存预算,能够在长上下文推理中实现更优的效率与准确性权衡。

🔬 方法详解

问题定义:本文旨在解决大型语言模型在长上下文推理中KV缓存的内存瓶颈问题。现有方法通常依赖简单的启发式,未能有效利用不同注意力头的特性,导致内存使用不够高效。

核心思路:SGD-KV框架通过引入块摘要诊断任务,系统性地识别和优先考虑在层次信息聚合中表现突出的注意力头,从而优化KV缓存的使用效率。

技术框架:SGD-KV的整体架构包括数据预处理、块摘要生成、注意力头评估和KV缓存优化四个主要模块。首先,对输入数据进行分块处理,然后生成摘要,接着评估各注意力头的性能,最后根据评估结果优化KV缓存的分配。

关键创新:SGD-KV的核心创新在于其头意识设计,能够根据注意力头的功能角色进行动态调整,与传统方法相比,显著提高了缓存的使用效率和推理性能。

关键设计:在设计中,采用了基于摘要评分的动态KV缓存分配策略,结合特定的损失函数来优化注意力头的选择,确保在长上下文推理中实现最佳的效率与准确性平衡。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

SGD-KV在Qwen2.5-7B-1M和Qwen3-32B的长上下文基准测试中表现出色,达到了最先进的性能,支持上下文长度高达1M,同时将KV缓存内存使用减少了多达75%。这一显著的提升展示了其在效率与准确性之间的优越权衡。

🎯 应用场景

SGD-KV的研究成果在多个领域具有广泛的应用潜力,尤其是在需要处理长文本或长上下文的自然语言处理任务中,如机器翻译、文本生成和对话系统等。通过优化内存使用,该方法能够提升模型的推理速度和响应效率,具有重要的实际价值和未来影响。

📄 摘要(原文)

Large language models (LLMs) face severe memory bottlenecks in long-context inference due to the linearly growing size of key-value (KV) caches. Existing KV cache compression techniques typically rely on simple heuristics, overlooking the distinct functional roles of different attention heads. We present SGD-KV (Summarization-Guided KV Cache Compression), a head-aware framework that leverages a novel chunk-summarization diagnostic task to systematically identify and prioritize attention heads specialized in hierarchical information aggregation. Experiments on Qwen2.5-7B-1M and Qwen3-32B across diverse long-context benchmarks demonstrate that SGD-KV achieves state-of-the-art performance with contexts up to 1M tokens, while reducing KV cache memory usage by up to 75%. Our findings show that strategically allocating the KV cache budget based on the summarization score distribution of attention heads yields a superior efficiency-accuracy trade-off for long-context inference.