SinkPruner: Sink-Free Visual Token Pruning for Multimodal Large Language Models
作者: Shiyu Li, Zi-Yuan Hu, Shijia Huang, Yanyang Li, Yiwu Zhong, Liwei Wang
分类: cs.CV, cs.AI, cs.CL, cs.LG
发布日期: 2026-09-01
备注: EMNLP 2026 (findings)
🔗 代码/项目: GITHUB
💡 一句话要点
提出SinkPruner以解决多模态大语言模型的视觉标记冗余问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 视觉标记剪枝 多模态大语言模型 高范数异常标记 推理效率 文本引导剪枝 视觉清理器 无训练框架
📋 核心要点
- 现有的视觉标记剪枝方法未能有效处理高范数异常标记,导致剪枝决策不佳。
- SinkPruner通过视觉清理器和文本引导剪枝器,提出了一种高效的无训练剪枝框架。
- 在实验中,SinkPruner在大幅减少标记的同时,保持了高达96.5%的原始模型性能。
📝 摘要(中文)
尽管多模态大语言模型(MLLMs)在理解能力上表现出色,但在处理长视觉标记序列时会产生巨大的计算开销。现有的视觉标记剪枝方法往往忽视了高范数异常标记,这些标记在特征和空间维度上高度冗余,却被误认为是重要信息。为此,本文提出了SinkPruner,一个无训练的视觉标记剪枝框架,旨在提高MLLM的推理效率。SinkPruner采用粗到细的设计,包含视觉清理器和文本引导剪枝器两个关键模块。通过在十二个图像-语言和四个视频-语言基准上的广泛实验,验证了该框架的有效性和高效性。SinkPruner在89%的标记减少下,保留了LLaVA-1.5(91.8%)的96.5%原始性能。
🔬 方法详解
问题定义:本文旨在解决多模态大语言模型在处理长视觉标记序列时的计算开销问题。现有方法未能有效识别和剪除高范数异常标记,导致冗余信息的保留,影响推理效率。
核心思路:SinkPruner的核心思路是通过视觉清理器过滤高范数冗余标记,并利用文本引导剪枝器保留与文本查询语义一致的标记,从而实现高效的标记剪枝。
技术框架:SinkPruner采用粗到细的设计,首先通过视觉清理器去除冗余标记,然后通过文本引导剪枝器进一步优化标记选择。整体流程包括标记的初步筛选和最终的语义对齐。
关键创新:SinkPruner的主要创新在于其训练无关的剪枝方法,特别是对高范数异常标记的有效处理,这与现有方法的依赖于训练的剪枝策略形成了鲜明对比。
关键设计:在设计中,视觉清理器的参数设置和损失函数经过精心调整,以确保高效过滤冗余标记,同时文本引导剪枝器的结构设计使其能够有效捕捉语义信息。具体的网络结构和参数设置在实验中进行了详细验证。
🖼️ 关键图片
📊 实验亮点
实验结果显示,SinkPruner在89%的标记减少下,保留了LLaVA-1.5模型96.5%的原始性能,且在Qwen2.5-VL模型中也达到了91.8%的性能保留。这表明SinkPruner在剪枝效率和效果上均优于现有方法,具有良好的通用性。
🎯 应用场景
SinkPruner的研究成果在多模态大语言模型的推理效率提升方面具有重要应用价值,尤其适用于需要处理大量视觉信息的场景,如图像描述生成、视频理解等。未来,该方法有望在实时系统和资源受限环境中得到广泛应用,推动多模态AI的发展。
📄 摘要(原文)
Despite their strong multimodal understanding ability, multimodal large language models (MLLMs) incur substantial computational overhead when processing long visual token sequences. To reduce inference costs, recent studies have explored visual token pruning through vision-centric or text-guided strategies. However, these methods often overlook high-norm outlier tokens, i.e., tokens with abnormally large feature norms, leading to suboptimal pruning decisions. In this work, we show that such high-norm outlier tokens are highly redundant in both feature and spatial dimensions, yet are often mistakenly preserved as informative cues by existing methods. Motivated by this observation, we propose SinkPruner, a training-free visual token pruning framework for efficient MLLM inference. SinkPruner follows a coarse-to-fine design with two key modules: a visual sanitizer that filters high-norm redundancies and alleviates attention sink and attention dispersion, and a text-guided pruner that further retains tokens semantically aligned with the text query. Extensive experiments on twelve image-language and four video-language benchmarks demonstrate the effectiveness, efficiency, and generalizability of our framework. Notably, SinkPruner preserves 96.5% (91.8%) of the original performance of LLaVA-1.5 (Qwen2.5-VL) under an 89% token reduction. Experiments further indicate that our visual sanitizer exhibits promising transferability in enhancing the performance of existing pruning methods. Our code is available at https://github.com/LaVi-Lab/SinkPruner.