PACE: A Unified Condense-and-Extract Paradigm for Fast VLM Inference

📄 arXiv: 2608.27206v1 📥 PDF

作者: Junjie Liu, Shengyuan Ye, Xu Chen

分类: cs.CV, cs.AI

发布日期: 2026-08-27

备注: 22 pages, 9 figures, 13 tables. Accepted to Findings of EMNLP 2026

🔗 代码/项目: GITHUB


💡 一句话要点

提出PACE以解决视觉语言模型推理速度慢的问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉语言模型 推理加速 多模态学习 自适应压缩 动态提取

📋 核心要点

  1. 现有视觉语言模型推理方法在视觉标记数量增加时,推理成本显著上升,且未能优化视觉编码阶段的延迟。
  2. PACE框架通过自适应像素压缩和动态双重注意力提取,优化视觉信息处理,提升推理速度和性能。
  3. 实验结果表明,PACE在使用10%视觉标记的情况下,仍能保持93.8%的性能,首次标记时间加速3.1倍。

📝 摘要(中文)

视觉语言模型(VLMs)展现了卓越的视觉推理能力,但随着视觉标记数量的增加,其推理成本迅速上升。现有的视觉标记剪枝方法存在两个基本局限:一是大多数方法仅在视觉编码器后操作,未优化视觉编码阶段的延迟;二是在严格的标记预算下,这些方法往往无法同时保留整体视觉上下文和细粒度细节,导致性能下降。为了解决这些瓶颈,本文提出了PACE(像素自适应压缩与提取),一个无训练推理框架,通过统一的压缩与提取范式加速视觉编码器和大型语言模型(LLM)。在压缩阶段,自适应像素压缩器(APC)在编码前评估视觉信息密度,自适应地下采样冗余输入,减少编码器计算,同时保留全局上下文和重要视觉线索。在提取阶段,动态双重注意力提取器(DDAE)通过融合编码器的内部视觉信号和LLM的语义信号,选择性地保留视觉标记,保护任务关键细节。将PACE集成到Qwen2.5-VL-7B中,模型在仅使用10%的视觉标记的情况下保留了93.8%的原始性能,实现了3.1倍的首次标记时间加速。

🔬 方法详解

问题定义:本文旨在解决视觉语言模型推理过程中由于视觉标记数量增加而导致的推理速度慢和性能下降的问题。现有方法在视觉编码阶段未能进行有效优化,且在严格的标记预算下,无法同时保留整体上下文和细节信息。

核心思路:PACE框架的核心思路是通过自适应压缩和动态提取机制,优化视觉信息的处理流程。自适应像素压缩器(APC)在编码前评估视觉信息密度,减少冗余输入;而动态双重注意力提取器(DDAE)则在提取阶段选择性保留重要的视觉标记。

技术框架:PACE框架分为两个主要阶段:压缩阶段和提取阶段。在压缩阶段,APC根据视觉信息密度自适应地下采样输入;在提取阶段,DDAE结合编码器的视觉信号和LLM的语义信号,选择性地保留重要的视觉标记。

关键创新:PACE的主要创新在于其训练-free的推理框架,通过统一的压缩与提取机制,显著提升了视觉语言模型的推理效率和性能。与现有方法相比,PACE能够在保持性能的同时,减少视觉标记的使用。

关键设计:在设计上,APC和DDAE的具体实现包括自适应的下采样策略和双重注意力机制,确保在减少计算量的同时,最大限度地保留任务相关的视觉信息。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,PACE在集成到Qwen2.5-VL-7B模型后,能够在仅使用10%的视觉标记的情况下,保留93.8%的原始性能,首次标记时间加速达到3.1倍,显著提升了推理效率。

🎯 应用场景

PACE框架具有广泛的应用潜力,特别是在需要快速推理的视觉语言任务中,如图像描述、视觉问答和多模态检索等领域。其高效的推理能力可以显著提升用户体验,并推动相关技术的实际应用和发展。

📄 摘要(原文)

Vision-Language Models (VLMs) demonstrate exceptional visual reasoning capabilities, yet their inference costs escalate rapidly with the proliferation of visual tokens. Existing visual token pruning methods exhibit two fundamental limitations. First, most approaches operate exclusively post-vision encoder, leaving the substantial latency of the visual encoding phase unoptimized. Second, under strict token budgets, these methods often fail to jointly preserve holistic visual contexts and fine-grained details, leading to performance degradation. To address these bottlenecks, we propose PACE (Pixel-Adaptive Condense and Extract), a training-free inference framework that accelerates both the vision encoder and the Large Language Model (LLM) via a unified Condense-and-Extract paradigm. During the Condense stage, an Adaptive Pixel Compressor (APC) evaluates visual information density prior to encoding, adaptively downsampling redundant inputs, curtailing encoder computation while preserving global context and essential visual cues. In the Extract stage, a Dynamic Dual-Attention Extractor (DDAE) selectively retains visual tokens via a fusion of internal visual signals from the encoder and semantic signals from the LLM, safeguarding task-critical details. By integrating PACE into Qwen2.5-VL-7B, the model retains 93.8% of its original performance while utilizing only 10% of the visual tokens, yielding a 3.1x speedup in time to first token (TTFT). Our code is available at https://github.com/jjL357/PACE.