SepPrune:A Separator-based Pruning Framework for Efficient Multimodal Large Language Models

📄 arXiv: 2607.25818v1 📥 PDF

作者: Yuchen Wang, Qihui Zhu, Yang Liu, Xiaoyan Sun, Siying Wu

分类: cs.CV

发布日期: 2026-07-28


💡 一句话要点

提出SepPrune框架以高效修剪多模态大语言模型

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态大语言模型 视觉标记修剪 模态分隔符 计算效率 无训练方法

📋 核心要点

  1. 现有的视觉标记修剪方法在高分辨率输入下计算成本高,且无法在预填充阶段进行有效修剪。
  2. 提出的SepPrune方法利用模态分隔符标记作为统一查询,进行信息丰富视觉标记的排名和选择,具有高效性和无训练特性。
  3. 实验结果显示,SepPrune在保留96.3%准确率的同时,成功去除了80.2%的视觉标记,展现出优越的性能。

📝 摘要(中文)

近年来的多模态大语言模型(MLLMs),如Qwen2.5-VL和InternVL3,在处理高分辨率输入时生成大量视觉标记,导致计算成本显著增加。现有的视觉标记修剪方法要么依赖于跨模态注意力,无法在预填充阶段进行修剪,要么依赖于多样性估计,计算开销较高。我们观察到,视觉和文本标记的注意力得分在模态分隔符标记处达到峰值,表明这些分隔符在两种模态之间起到桥梁作用。基于这一观察,我们提出了SepPrune,这是一种高效的、无训练的、即插即用的修剪方法,利用分隔符标记作为统一查询来排名和选择信息丰富的视觉标记。SepPrune重用LLM内置的投影参数,无需架构更改。实验结果表明,SepPrune在Qwen2.5-VL-7B上实现了最先进的性能,保留了96.3%的原始准确率,同时去除了80.2%的视觉标记。

🔬 方法详解

问题定义:本论文旨在解决多模态大语言模型在处理高分辨率输入时,视觉标记数量庞大导致的计算成本高的问题。现有方法要么依赖于跨模态注意力,无法在预填充阶段进行修剪,要么计算开销较高。

核心思路:论文的核心思路是利用模态分隔符标记的注意力得分峰值,作为统一查询来排名和选择信息丰富的视觉标记,从而实现高效修剪。这样的设计能够在不增加计算负担的情况下,优化视觉标记的使用。

技术框架:整体架构包括三个主要模块:首先,利用模态分隔符标记获取注意力得分;其次,根据得分对视觉标记进行排名;最后,选择信息丰富的视觉标记进行保留。该方法无需对现有架构进行修改,且可直接应用。

关键创新:最重要的技术创新点在于提出了基于模态分隔符的修剪方法,这与现有依赖于跨模态注意力或多样性估计的修剪方法有本质区别,显著降低了计算复杂度。

关键设计:该方法重用LLM内置的投影参数,避免了额外的训练过程,且在参数设置上保持简洁,确保了修剪过程的高效性和准确性。实验中使用的损失函数和选择标准也经过精心设计,以确保信息的保留。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,SepPrune在Qwen2.5-VL-7B模型上实现了96.3%的准确率,同时去除了80.2%的视觉标记,展现出优于现有方法的性能,具有显著的计算效率提升。

🎯 应用场景

该研究的潜在应用领域包括智能助手、自动驾驶、医疗影像分析等多模态任务。通过高效修剪,能够显著降低计算资源消耗,提高模型在实际应用中的响应速度和处理能力,具有重要的实际价值和未来影响。

📄 摘要(原文)

Recent multimodal large language models (MLLMs), such as Qwen2.5-VL and InternVL3, generate large numbers of vision tokens for high-resolution inputs, leading to substantial computational cost. Existing vision token pruning methods either depend on cross-modal attention and cannot prune before the prefill stage, or rely on diversity estimation with high computational overhead. We observe that attention scores from both vision and text tokens peak at modality separator tokens, suggesting that these separators bridge the two modalities. Based on this observation, we propose SepPrune, an efficient, training-free, plug-and-play pruning method that uses the separator token as a unified query to rank and select informative vision tokens. SepPrune reuses the LLM's built-in projection parameters and requires no architectural changes. Experiments on Qwen2.5-VL-7B show that SepPrune achieves state-of-the-art performance, retaining 96.3% of the original accuracy while removing 80.2% of vision tokens.