Cut-ViT: Task-Specific Model Pruning via Gram Anchoring Subspace Consistency
作者: Jianjian Yin, Liulei Li, Tao Chen, Yi Chen, Yazhou Yao, Wenguan Wang
分类: cs.CV
发布日期: 2026-08-28
备注: Accepted by ECCV2026
💡 一句话要点
提出Cut-ViT以解决视觉基础模型剪枝的鲁棒性和任务特异性问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 视觉模型剪枝 Gram锚定 子空间一致性 DINOv3 谱熵适应 任务特定剪枝 计算机视觉 深度学习
📋 核心要点
- 现有剪枝方法在单一数据集上进行刚性标记对齐,导致鲁棒性下降和任务特异性不足。
- 本文提出Cut-ViT,通过构建Gram锚定矩阵和子空间分解,解决剪枝过程中的对齐问题。
- 实验结果显示Cut-ViT在时间和内存使用上显著优于以往方法,同时在多个任务上实现了最佳性能。
📝 摘要(中文)
剪枝视觉基础模型引起了广泛关注。然而,现有方法在单一数据集上进行刚性点对点的标记对齐,面临鲁棒性下降和任务特异性不足的两大限制。为了解决这些问题,本文提出了一种名为Cut-ViT的任务特定剪枝管道。具体而言,我们从空间和语义角度构建Gram锚定矩阵,并进行子空间分解以提取相应的子空间基。采用与基无关的约束和残差约束,使得剪枝后的DINOv3模型与原始模型在空间和通道维度上对齐Gram子空间,从而使子网络继承原始DINOv3的鲁棒特征表示。此外,我们设计了谱熵适应,量化特征流形在空间和通道维度上的信息密度,从而将剪枝目标适应于特定下游任务。实验表明,Cut-ViT在单个A100 GPU上仅需约一分钟即可获得不同稀疏级别的子网络,所需时间为以往方法的20.9%,GPU内存为45.5%,同时在九个数据集的六个任务上实现了SOTA性能。
🔬 方法详解
问题定义:本文旨在解决现有视觉基础模型剪枝方法在鲁棒性和任务特异性方面的不足,尤其是在单一数据集上进行的刚性点对点标记对齐导致的性能下降问题。
核心思路:提出了一种任务特定的剪枝管道Cut-ViT,通过构建Gram锚定矩阵并进行子空间分解,使得剪枝后的模型能够继承原始模型的特征表示,从而提高鲁棒性和适应性。
技术框架:Cut-ViT的整体架构包括Gram锚定矩阵的构建、子空间分解、基无关和残差约束的应用,以及谱熵适应的设计。这些模块共同作用,实现了对剪枝目标的有效适应。
关键创新:最重要的创新在于通过Gram锚定矩阵和子空间对齐,使得剪枝后的模型能够在空间和通道维度上保持特征一致性,这与现有方法的刚性对齐方式形成了鲜明对比。
关键设计:在参数设置上,采用了基无关和残差约束来确保特征对齐,同时设计了谱熵适应机制,以量化特征流形的信息密度,从而优化剪枝目标。
🖼️ 关键图片
📊 实验亮点
Cut-ViT在单个A100 GPU上仅需约一分钟即可获得不同稀疏级别的子网络,所需时间为以往方法的20.9%,GPU内存使用为45.5%。在九个数据集的六个任务上,Cut-ViT实现了当前最佳性能,显示出其在剪枝效率和效果上的显著提升。
🎯 应用场景
该研究的潜在应用领域包括计算机视觉中的图像分类、目标检测和图像分割等任务。Cut-ViT的剪枝方法能够有效降低模型的计算资源需求,同时保持高性能,适用于资源受限的环境。未来,该方法可能在边缘计算和移动设备上得到广泛应用,推动智能设备的普及和应用。
📄 摘要(原文)
Pruning visual foundation models has attracted considerable attention. However, existing methods focus on rigid point-to-point token alignment on a single dataset for pruning, suffering from two limitations: i) robustness degradation, and ii) task-specificity deficiency. To address these limitations, we propose a task-specific pruning pipeline, named Cut-ViT. Specifically, we first construct gram anchoring matrices from both spatial and semantic perspectives, and perform the subspace decomposition to extract the corresponding subspace bases. Basis-agnostic and residual constraints are then adopted to align the gram subspaces between the native and pruned DINOv3 models along spatial and channel dimensions, enabling subnetworks to inherit robust feature representations of native DINOv3. Furthermore, we design spectral entropy adaptation, which quantifies the information density of feature manifolds along spatial and channel dimensions, thereby adapting the pruning objective to specific downstream tasks. Experiments show that Cut-ViT requires approximately one minute on a single A100 GPU to obtain subnetworks at various sparsity levels, using only 20.9% of the time and 45.5% of the GPU memory compared with previous methods, while achieving SOTA performance on six tasks across nine datasets.