Prune Once: Retraining-Free Task-Agnostic Pruning for Vision-Language Models

📄 arXiv: 2608.06901v1 📥 PDF

作者: Minseok Kang, Hyunwoo Kim, Chanyoung Kim, Minwoo Kim, Jaekoo Lee, Dahuin Jung

分类: cs.CV, cs.LG

发布日期: 2026-08-07

备注: Accepted to ECCV 2026

🔗 代码/项目: GITHUB


💡 一句话要点

提出PORTA以解决视觉语言模型的高效剪枝问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉语言模型 剪枝技术 多模态学习 无重训练 自适应稀疏 模型压缩 激活变化

📋 核心要点

  1. 现有剪枝方法通常依赖于特定任务的标准,无法适应无任务样本的剪枝需求,限制了其广泛应用。
  2. 本文提出PORTA框架,通过激活变化推导出任务和模态无关的重要性度量,支持高效剪枝。
  3. 实验结果显示,PORTA在多种VLM架构下实现了高稀疏情况下的竞争性性能,无需重训练,显著提升了压缩效率。

📝 摘要(中文)

视觉语言模型(VLMs)在多模态任务中展现了卓越的泛化能力,但其日益增长的计算和内存需求在受限环境中部署时面临重大挑战。现有的剪枝策略通常依赖于特定任务的标准或大型语言模型的权重重要性度量,因而不适用于无任务样本的任务无关剪枝。本文提出了一种名为PORTA的无重训练VLM剪枝框架,该框架基于通用校准数据估计的激活变化,推导出任务和模态无关的重要性公式,可靠地捕捉跨模态的特征表示效用。PORTA还结合了一种自适应稀疏分配机制,根据输出特征的变异性分配层级剪枝比例,避免了均匀稀疏的局限性,并在高压缩水平下减少性能下降。大量实验表明,PORTA在高稀疏下实现了竞争性的下游性能,无需任何重训练,支持高效的VLM压缩。

🔬 方法详解

问题定义:本文旨在解决视觉语言模型在高压缩情况下的剪枝问题,现有方法往往依赖于特定任务的标准,导致无法在无任务样本的情况下进行有效剪枝。

核心思路:PORTA框架通过激活变化推导出任务和模态无关的重要性度量,利用通用校准数据来评估特征表示的效用,从而实现无重训练的剪枝。

技术框架:PORTA的整体架构包括重要性度量模块和自适应稀疏分配机制。重要性度量模块基于激活变化评估特征效用,自适应稀疏分配机制则根据输出特征的变异性动态调整剪枝比例。

关键创新:PORTA的主要创新在于其无重训练的剪枝策略和自适应稀疏分配机制,这与传统方法依赖于特定任务标准的方式有本质区别。

关键设计:在设计中,PORTA使用通用校准数据来估计激活变化,并根据输出特征的变异性来分配剪枝比例,避免了均匀稀疏带来的性能下降。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,PORTA在CLIP、BLIP和Qwen2-VL等多种VLM架构下,在高达80%的稀疏率下仍能保持竞争性的下游性能,相较于传统剪枝方法,性能下降幅度显著降低,展示了其高效性和实用性。

🎯 应用场景

该研究的潜在应用领域包括智能手机、嵌入式设备和边缘计算等受限环境中的视觉语言模型部署。通过高效的剪枝策略,PORTA能够在不牺牲性能的情况下,显著降低模型的计算和内存需求,推动多模态AI技术的普及与应用。

📄 摘要(原文)

Vision-language models (VLMs) have achieved remarkable generalization across diverse multimodal tasks through large-scale pre-training, yet their rapidly increasing computational and memory requirements pose significant challenges for deployment in constrained environments. Existing pruning strategies often depend on task-specific criteria or LLM-oriented importance measures, making them unsuitable for task-agnostic pruning, where no task-specific samples are available at pruning time and the pruned model remains broadly applicable. We introduce a retraining-free VLM pruning framework called PORTA that derives a task- and modality-agnostic importance formulation based on activation variation, estimated from generic calibration data, which reliably captures feature-level representation utility across modalities. PORTA further incorporates an adaptive sparsity allocation mechanism that assigns layer-wise pruning ratios based on output feature variability, avoiding the limitations of uniform sparsity and reducing performance degradation at high compression levels. Extensive experiments across VLM architectures, such as CLIP, BLIP, and Qwen2-VL, demonstrate that PORTA achieves competitive downstream performance under high sparsity without requiring any retraining, supporting efficient VLM compression. Code is available at https://github.com/cau-hai-lab/PORTA.git.