Unifying Depth and Width Pruning for LLMs via Binary Knapsack Optimization

📄 arXiv: 2608.12953v1 📥 PDF

作者: Palaash Goel, Ayan Sengupta, Akshay Nambi, Tanmoy Chakraborty

分类: cs.CL, cs.LG

发布日期: 2026-08-13

备注: 29 pages, 5 figures, 17 tables


💡 一句话要点

提出SNIPER框架以优化大语言模型的结构化剪枝

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 结构化剪枝 大语言模型 背包优化 压缩算法 性能保持 任务稳定性 模型压缩

📋 核心要点

  1. 现有的结构化剪枝方法依赖贪婪启发式,导致无法精确满足目标压缩预算,影响模型性能。
  2. SNIPER框架通过两阶段的剪枝策略,首先进行粗粒度的背包优化,再进行细粒度剪枝,以实现预算的严格遵循。
  3. 实验结果表明,SNIPER在多个架构和任务上表现出色,平均排名为1.25,显示出其跨架构的通用性和可靠性。

📝 摘要(中文)

结构化剪枝是一种有前景的压缩大语言模型(LLMs)的方法,但现有方法过于依赖贪婪启发式,导致决策短视,常常无法精确满足目标压缩预算。本文提出了SNIPER,一个两阶段的结构化剪枝框架,通过对粗粒度组件进行背包优化,生成相对最优的参数分配,随后进行细粒度剪枝以满足严格的预算约束。引入的压缩比遵循因子(CRAFT)量化预算保真度,结果显示,SNIPER在压缩比方面的偏差仅为0.02,显著优于现有剪枝方法。对四种不同架构的18个任务的评估表明,SNIPER在平均性能保持和任务级稳定性上均优于六种最先进的剪枝方法。

🔬 方法详解

问题定义:本文旨在解决现有结构化剪枝方法在压缩大语言模型时的不足,尤其是无法精确满足目标压缩预算的问题。现有方法通常依赖贪婪启发式,导致决策短视,影响最终模型性能。

核心思路:SNIPER框架的核心思路是采用两阶段的剪枝策略,首先通过背包优化在粗粒度组件上进行条件最优的参数分配,随后在细粒度层面进行剪枝,以确保满足严格的预算约束。

技术框架:SNIPER的整体架构分为两个主要阶段:第一阶段是粗粒度的背包优化,确定重要性估计下的参数分配;第二阶段是细粒度剪枝,确保最终的压缩比符合预算要求。

关键创新:SNIPER的关键创新在于引入了压缩比遵循因子(CRAFT),用于量化剪枝过程中的预算保真度,显示出其在压缩比方面的优越性,偏差仅为0.02,远低于现有方法。

关键设计:在设计中,SNIPER采用了固定的重要性估计,并通过两阶段的优化策略来实现剪枝,确保了在不同架构和任务下的性能稳定性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

SNIPER在多个实验中表现出色,压缩比遵循因子(CRAFT)得分高达0.98,显示出其在预算遵循方面的优越性。与六种最先进的剪枝方法相比,SNIPER在平均性能保持和任务级稳定性上均有显著提升,平均排名为1.25,体现了其跨架构的通用性和可靠性。

🎯 应用场景

该研究的潜在应用领域包括自然语言处理、机器翻译和对话系统等大语言模型的优化。通过有效的结构化剪枝,SNIPER能够在保持模型性能的同时,显著降低计算资源的消耗,具有重要的实际价值和未来影响。

📄 摘要(原文)

Structured pruning is a promising approach for compressing large language models (LLMs), yet existing methods rely heavily on greedy heuristics that produce myopic decisions, and often fail to precisely meet target compression budgets. We present SNIPER, a two-stage structured pruning framework that solves a knapsack optimization over coarse-granularity components to yield conditionally optimal parameter allocations with respect to fixed importance estimates, followed by a fine-grained pruning stage to meet strict budget constraints. We introduce the Compression Ratio Adherence Factor (CRAFT) to quantify budget fidelity, showing that while existing pruners deviate from target compression ratios by up to 33%, SNIPER achieves near-exact adherence with a CRAFT score of 0.98. Evaluations across four diverse architectures over a set of 18 tasks spanning five domains demonstrate SNIPER's consistent improvements in average performance retention and task-level stability over six state-of-the-art pruners. Across all pruning configurations, SNIPER achieves an excellent mean rank of 1.25, indicating its robust cross-architectural generalizability and excellent reliability.