Prox: Training-Free FFN Activation Sparsity via Approximate Intermediate-Channel Salience in LLMs

📄 arXiv: 2607.27591v1 📥 PDF

作者: Jinyi Liu, Wei Chen, Pengyu Chen, Xinyi Yuan, Minghe Bai, Guoquan Wu, Jun Wei

分类: cs.LG, cs.CL

发布日期: 2026-07-30


💡 一句话要点

提出Prox框架以解决LLM中FFN激活稀疏性问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 前馈网络 激活稀疏化 大型语言模型 SwiGLU 无训练方法 计算效率 模型优化

📋 核心要点

  1. 现有的无训练激活稀疏化方法在高稀疏度下会导致模型质量显著下降,主要由于通道选择策略的不足。
  2. 论文提出的Prox框架通过利用SwiGLU中间状态的大小排名构建通道掩码,从而实现稀疏执行,避免了昂贵的密集计算。
  3. Prox在多个大型语言模型上进行实验,结果显示其在所有稀疏度水平上均优于现有基线,并在70%稀疏度下实现了1.99倍的解码速度提升。

📝 摘要(中文)

前馈网络(FFNs)在大型语言模型(LLMs)推理中占据了主要的内存流量和计算资源,因此成为激活稀疏化的主要目标。然而,现有的无训练方法在高稀疏度下会显著降低模型质量,主要由于其通道选择策略的局限性。我们观察到SwiGLU中间状态提供了有效的通道选择信号,但获取该信号需要昂贵的密集计算。为此,我们提出了Prox,一个两阶段的无训练框架,用于稀疏SwiGLU FFNs。Prox的关键见解在于:稀疏执行仅需要由中间状态诱导的通道掩码,该掩码可以通过其条目的大小排名构建,而无需其确切值。具体而言,第一阶段利用输入稀疏性和量化代理权重构建共享掩码;第二阶段精确计算所选通道,从而实现所有三个投影的稀疏执行。在六个模型系列的十个LLMs中,Prox在所有稀疏度水平上均优于无训练基线,在70% FFN稀疏度下实现了高达1.99倍的端到端解码加速,并与量化和稀疏注意力兼容。

🔬 方法详解

问题定义:论文要解决的问题是如何在大型语言模型中有效地实现前馈网络的激活稀疏性,现有无训练方法在高稀疏度下导致模型质量下降,主要是由于通道选择策略的局限性。

核心思路:论文的核心思路是利用SwiGLU中间状态的大小排名来构建通道掩码,从而实现稀疏执行。这种方法避免了昂贵的密集计算,同时保持了模型性能。

技术框架:Prox框架分为两个阶段:第一阶段利用输入稀疏性和量化代理权重构建共享掩码;第二阶段则精确计算所选通道,以实现所有三个投影的稀疏执行。

关键创新:最重要的技术创新点在于通过中间状态的大小排名构建通道掩码,而不是依赖于其确切值,这与现有方法的本质区别在于计算效率和模型质量的平衡。

关键设计:在设计上,Prox使用了量化代理权重和输入稀疏性来构建共享掩码,确保了计算的高效性和准确性,同时在第二阶段精确计算所选通道以实现稀疏执行。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

Prox框架在六个模型系列的十个大型语言模型上进行了实验,结果显示其在所有稀疏度水平上均优于现有的无训练基线。在70% FFN稀疏度下,Prox实现了高达1.99倍的端到端解码速度提升,展现了其卓越的性能和效率。

🎯 应用场景

该研究的潜在应用领域包括自然语言处理、机器翻译和对话系统等大型语言模型的推理任务。通过提高FFN的稀疏性,Prox框架能够显著降低计算资源的消耗,提升推理速度,具有实际的商业价值和广泛的应用前景。

📄 摘要(原文)

Feed-forward networks (FFNs) dominate memory traffic and computation in large language model (LLM) inference, making them a primary target for activation sparsification. However, existing training-free methods suffer substantial model-quality degradation at high sparsity due to limitations in their channel-selection strategies. We observe that the SwiGLU intermediate state provides a highly effective channel-selection signal, but obtaining it requires costly dense computation. To address this, we present \emph{Prox}, a two-stage training-free framework for sparse SwiGLU FFNs. Prox hinges on the key insight: sparse execution requires only the channel mask induced by the intermediate state, which can be constructed from the magnitude ranking of its entries rather than their exact values. Specifically, Stage 1 uses input sparsity and quantized proxy weights to construct a shared mask; Stage 2 computes the selected channels exactly, enabling sparse execution of all three projections. Across ten LLMs from six model families, Prox outperforms training-free baselines at all sparsity levels, achieves up to a $1.99\times$ end-to-end decoding speedup at 70\% FFN sparsity, and is compatible with quantization and sparse attention.