Reservoir of Importance: Learning Semi-Structured Sparsity with Differentiable Subset Sampling
作者: Ha Dinh, Xuan Duy Ta, Khoat Than, Khac-Hoai Nam Bui
分类: cs.LG
发布日期: 2026-08-24
备注: Accepted as an EMNLP 2026 Main Conference paper
💡 一句话要点
提出Reservoir of Importance以解决大语言模型稀疏性问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 半结构化稀疏性 可学习掩码 大语言模型 内存效率 模型剪枝 深度学习
📋 核心要点
- 现有的可学习掩码方法在参数和内存开销上存在显著问题,限制了其在大型语言模型中的应用。
- 本文提出Reservoir of Importance框架,通过可微分子集采样学习稀疏掩码,显著降低了可训练参数的复杂度。
- 实验结果表明,RoI在多个Qwen2.5 LLM模型上实现了1.5-8.75倍的参数减少,同时保持了良好的性能和内存效率。
📝 摘要(中文)
半结构化的N:M稀疏性已成为加速大型语言模型(LLMs)的实用方向。然而,现有的可学习掩码方法存在显著的参数和内存开销,限制了其在大模型和激进稀疏性下的可扩展性。本文从效率与可扩展性相结合的角度重新审视半结构化剪枝,提出了一种轻量级的半结构化剪枝框架Reservoir of Importance(RoI),通过可微分子集采样学习稀疏掩码。与之前的方法不同,RoI引入了紧凑的logit参数化来学习稀疏掩码,并通过不放回采样选择掩码,从而将可训练参数从组合复杂度降低到O(M)。因此,RoI所需的可学习参数减少了1.5-8.75倍,显著降低了内存成本,同时与硬件友好的稀疏模式完全对齐。对Qwen2.5 LLM系列(0.5-7B参数)的多尺度评估表明,RoI在强大的内存效率、稳定性和对更激进的N:M稀疏模式的可扩展性方面表现出竞争力,为高效的LLM部署提供了实用路径。
🔬 方法详解
问题定义:本文旨在解决现有可学习掩码方法在大型语言模型中造成的高参数和内存开销问题,这限制了其在激进稀疏性下的可扩展性。
核心思路:论文提出的Reservoir of Importance(RoI)框架通过可微分子集采样来学习稀疏掩码,采用紧凑的logit参数化,从而降低了可训练参数的复杂度,提升了效率。
技术框架:RoI的整体架构包括稀疏掩码学习模块和不放回采样模块。稀疏掩码学习模块负责生成稀疏掩码,而不放回采样模块则用于选择最优掩码,确保了训练过程的高效性。
关键创新:RoI的主要创新在于引入了紧凑的logit参数化和不放回采样机制,这与传统方法的全类别分布建模形成了鲜明对比,显著降低了参数数量。
关键设计:在设计中,RoI通过优化损失函数来平衡稀疏性与性能,采用了适应性学习率和正则化策略,以确保模型的稳定性和收敛性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,RoI在多个Qwen2.5 LLM模型上实现了1.5-8.75倍的参数减少,同时在内存效率和模型稳定性方面表现出色,证明了其在激进N:M稀疏模式下的可扩展性。
🎯 应用场景
该研究的潜在应用领域包括大型语言模型的高效部署,尤其是在资源受限的环境中。RoI框架的设计使其能够在保持性能的同时,显著降低内存和计算开销,具有广泛的实际价值和未来影响。
📄 摘要(原文)
Semi-structured $N$:$M$ sparsity has emerged as a practical direction for accelerating large language models (LLMs). However, existing learnable-mask approaches incur substantial parameter and memory overhead, limiting their scalability to large models and aggressive sparsity regimes. In this work, we revisit semi-structured pruning from a perspective that reconciles efficiency with scalability. We propose Reservoir of Importance (RoI), a lightweight semi-structured pruning framework that learns sparsity masks through differentiable subset sampling. Unlike prior methods that model full categorical distributions over all feasible $N$:$M$ patterns, RoI introduces a compact-logit parameterization for sparsity mask learning and performs sampling without replacement to select masks, thereby reducing trainable parameters from combinatorial complexity to $\mathcal{O}({M})$. As a result, RoI requires 1.5-8.75$\times$ fewer learnable parameters and significantly lower memory cost, while remaining fully aligned with hardware-friendly sparsity patterns. Extensive evaluations across multiple scales of the Qwen2.5 LLM family (0.5-7B parameters) demonstrate that RoI achieves competitive performance with strong memory efficiency, stability, and scalability to more aggressive $N$:$M$ sparsity patterns, offering a practical path toward efficient LLM deployment.