Capturing Token Tendencies for Training-Free Token Pruning in Multimodal Large Language Models

📄 arXiv: 2607.28341v1 📥 PDF

作者: Jie Ma, Zhike Qiu, Jie Gao, Jiayi Ji, Qian Chen, Xiaoshuai Sun, Rongrong Ji

分类: cs.CV

发布日期: 2026-07-30


💡 一句话要点

提出趋势感知修剪以解决多模态大语言模型的视觉令牌过滤问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态大语言模型 视觉令牌修剪 动态校正机制 注意力流 效率提升 深度学习 无训练方法

📋 核心要点

  1. 现有的无训练视觉令牌修剪方法依赖静态启发式,导致重要令牌在推理过程中被过早丢弃。
  2. 提出趋势感知修剪,通过捕捉注意力流的动量,动态调整令牌的重要性,避免关键信息丢失。
  3. 实验结果显示,该方法在多模态任务中减少视觉令牌超过77.8%,最终层仅保留约23个令牌,同时保持竞争性能。

📝 摘要(中文)

在多模态大语言模型(MLLMs)中,视觉令牌修剪对于提高效率至关重要。然而,现有的无训练方法存在一个关键限制:它们依赖静态的瞬时启发式方法进行不可逆的过滤。这种方法忽视了MLLMs的层次结构特性,令牌的重要性往往是动态变化的,而不是在各层之间保持固定。因此,深层推理所需的令牌常常被浅层估计过早丢弃。为了解决这个问题,我们提出了趋势感知修剪,这是一种新颖的框架,将修剪从局部快照决策提升为时间轨迹建模问题。我们的办法捕捉注意力流的动量,使得动态校正机制能够选择性地重新激活那些最初被低估但语义重要性上升的“晚开花”令牌,从而防止关键视觉线索的丢失。大量实验表明,我们的方法在多种多模态任务中实现了更优的效率与性能权衡。

🔬 方法详解

问题定义:论文要解决的问题是现有无训练视觉令牌修剪方法的局限性,这些方法依赖静态的瞬时启发式,导致在多层次推理中重要令牌被过早丢弃。

核心思路:论文的核心解决思路是通过趋势感知修剪,将修剪过程视为时间轨迹建模问题,捕捉注意力流的动态变化,从而动态调整令牌的重要性。

技术框架:整体架构包括数据输入、注意力流动捕捉、动态校正机制和最终的令牌选择模块。数据输入经过注意力机制,提取出每个令牌的动态特征,随后通过校正机制决定是否保留令牌。

关键创新:最重要的技术创新点在于引入了动态校正机制,能够重新激活那些在初始阶段被低估但在后续推理中变得重要的令牌,这与现有方法的静态决策形成了本质区别。

关键设计:关键设计包括动态校正的参数设置,损失函数的选择,以及网络结构的优化,确保模型能够有效捕捉和利用注意力流的变化。具体的参数设置和网络结构细节在实验部分进行了详细描述。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,趋势感知修剪方法在多模态任务中显著提高了效率,视觉令牌减少超过77.8%,最终层仅保留约23个令牌,同时保持了与基线模型相当的性能,展示了其优越的效率-性能权衡。

🎯 应用场景

该研究的潜在应用领域包括计算机视觉、自然语言处理和多模态学习等。通过提高多模态大语言模型的效率,能够在实时推理、资源受限的设备上实现更高效的应用,具有重要的实际价值和未来影响。

📄 摘要(原文)

While visual token pruning is essential for efficient Multimodal Large Language Models (MLLMs), existing training-free methods suffer from a critical limitation: they rely on static, instantaneous heuristics to perform irreversible filtering. This approach ignores the hierarchical nature of MLLMs, where token importance often evolves dynamically rather than remaining fixed across layers. Consequently, tokens essential for deep-layer reasoning are often prematurely discarded by shallow-layer estimates. To address this, we propose Trend-aware Pruning, a novel framework that elevates pruning from a local snapshot decision to a temporal trajectory modeling problem. Instead of relying on isolated scores, our method captures the momentum of attention flow. This enables a dynamic rectification mechanism that selectively reactivates "late-blooming" tokens, those initially undervalued but exhibiting rising semantic importance, thereby preventing the loss of critical visual cues. Extensive experiments demonstrate that our approach achieves a superior efficiency-performance trade-off across diverse multimodal tasks. Notably, it reduces visual tokens by over 77.8%, retaining only approximately 23 tokens in the final layer while maintaining competitive performance, offering a robust and reversible solution for high-efficiency multimodal inference.