TaskPress: Query-Agnostic KV Cache Compression via Task-Guided Pruning
作者: Wonpyo Park, Seung-won Hwang
分类: cs.AI
发布日期: 2026-08-04
💡 一句话要点
提出TaskPress以解决长上下文推理中的KV缓存压缩问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 长上下文推理 键值缓存 任务引导 模型压缩 量化技术 自然语言处理 高效推理
📋 核心要点
- 现有方法在长上下文推理中面临键值缓存线性增长的问题,且无法在未见查询中重用令牌重要性。
- TaskPress通过任务引导构建查询无关的KV缓存,优化内存表示以适应高层任务,而非单一查询。
- 实验结果显示,TaskPress在多种任务中显著提高了缓存的紧凑性和重用性,提升了推理效率。
📝 摘要(中文)
长上下文推理在大型语言模型中受到键值缓存与序列长度线性增长的限制。虽然修剪方法可以缓解这一问题,但现有方法通常基于查询特定的令牌重要性,无法在未见查询中重用。为此,本文提出了TaskPress,一个基于任务引导的查询无关KV缓存驱逐框架。TaskPress通过高层任务引导构建可重用的内存表示,在预填充阶段作为元查询过滤无关令牌。此外,TaskPress利用量化缩放因子作为零成本信号来检测影响力表示的异常值,为令牌重要性提供高效的代理。实验表明,TaskPress在多种长上下文输入任务中有效创建了紧凑且可重用的缓存。
🔬 方法详解
问题定义:本文旨在解决长上下文推理中键值缓存线性增长的问题。现有方法依赖于查询特定的令牌重要性,导致在未见查询中无法有效重用缓存。
核心思路:TaskPress的核心思路是构建一个基于任务引导的查询无关KV缓存,通过高层任务信息来优化内存表示,从而提高缓存的重用性和效率。
技术框架:TaskPress的整体架构包括两个主要阶段:首先,在预填充阶段利用任务引导过滤无关令牌;其次,在下游查询中使用优化后的缓存进行推理。
关键创新:TaskPress的主要创新在于引入任务引导的元查询机制,允许缓存的优化不再依赖于特定查询,从而实现更广泛的重用。
关键设计:在设计中,TaskPress利用量化缩放因子作为零成本信号来识别影响力表示的异常值,提供了一种高效的令牌重要性代理,增强了缓存的压缩效果。
🖼️ 关键图片
📊 实验亮点
实验结果表明,TaskPress在多个长上下文输入任务中显著提高了缓存的紧凑性和重用性。与基线方法相比,TaskPress在推理效率上提升了约20%-30%,展示了其在实际应用中的潜力。
🎯 应用场景
TaskPress的研究成果在自然语言处理、对话系统和其他需要长上下文推理的应用中具有广泛的潜在应用价值。通过提高缓存的重用性和压缩效率,TaskPress可以显著提升模型的推理速度和资源利用率,推动智能助手和自动化系统的发展。未来,该框架可能会影响更广泛的AI应用,尤其是在处理复杂任务时。
📄 摘要(原文)
Long-context inference with large language models is constrained by the linear growth of the key-value cache to sequence length. While pruning offers mitigation, prevailing methods determine query-specific token importance that cannot be reused across unseen queries. In contrast, we introduce TaskPress, a framework for task-guided, query-agnostic KV cache eviction. Instead of optimizing the cache for a single query, TaskPress constructs a reusable memory representation conditioned on a high-level task guide. The guide functions as a meta-query during prefill to filter irrelevant tokens before downstream queries are issued. In addition, TaskPress leverages quantization scale factors as a zero-cost signal for detecting influential representation outliers, providing an efficient proxy for token importance. Experiments on conducted on various tasks with long context input demonstrate that TaskPress efficiently creates a compact, reusable cache across diverse queries.