Debias-SparseGPT: Bias-Aware Pruning for Large Language Models

📄 arXiv: 2609.02496v1 📥 PDF

作者: Irina Proskurina, Guillaume Metzler, Antoine Gourru, Julien Velcin

分类: cs.CL

发布日期: 2026-09-02

备注: Accepted to EMNLP 2026, Code: https://github.com/upunaprosk/debias-llm-compressor


💡 一句话要点

提出Debias-SparseGPT以解决大语言模型的偏见问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大语言模型 模型压缩 去偏见 剪枝技术 自然语言处理 公平性 稀疏化方法

📋 核心要点

  1. 现有的稀疏化方法(如SparseGPT)可能会放大大语言模型中的偏见,导致输出结果的不一致性。
  2. Debias-SparseGPT通过引入基于人口统计对比输入的二阶项,实现了对模型的去偏见剪枝,旨在减少偏见的影响。
  3. 实验结果表明,Debias-SparseGPT在不同稀疏性条件下均能有效降低剪枝引起的偏见,同时保持模型性能,尤其在2:4结构稀疏下表现突出。

📝 摘要(中文)

模型压缩技术如剪枝和量化促进了大语言模型(LLMs)的高效部署和加速。然而,近期研究表明,权重稀疏化方法(如SparseGPT)可能会放大模型中的现有偏见,导致输出结果因提示中的角色线索而显著变化。本文提出了Debias-SparseGPT,这是一种后训练剪枝方法,结合了基于人口统计对比输入的二阶项的表征去偏见。我们对多种生成性LLM进行了实证验证。在不同模型和稀疏性条件下(25%、50%和结构化2:4稀疏),Debias-SparseGPT在减少剪枝引起的偏见方面表现优于SparseGPT,同时保持模型的困惑度和零-shot准确性。在最严格的2:4结构稀疏模式下,通过增加长上下文、内容丰富的示例来增强校准集,进一步改善了下游性能和公平性。总体而言,Debias-SparseGPT在保持稀疏模型计算效率的同时,推动了偏见与性能之间的权衡。

🔬 方法详解

问题定义:本文旨在解决大语言模型在使用稀疏化方法时可能放大偏见的问题。现有方法如SparseGPT在剪枝过程中未能有效控制模型输出的偏见,导致结果因提示内容而显著变化。

核心思路:Debias-SparseGPT的核心思路是结合表征去偏见技术,通过引入一个基于人口统计对比输入的二阶项,来减少剪枝引起的偏见。这种设计旨在在保持模型性能的同时,降低输出的偏见程度。

技术框架:该方法的整体架构包括两个主要阶段:首先进行模型的剪枝,随后应用去偏见技术。剪枝阶段采用不同的稀疏性设置(如25%、50%和2:4结构稀疏),而去偏见阶段则通过调整校准集来增强模型的公平性和性能。

关键创新:Debias-SparseGPT的关键创新在于其引入的二阶去偏见项,这一设计与现有的稀疏化方法本质上不同,能够有效减少剪枝带来的偏见影响。

关键设计:在参数设置上,Debias-SparseGPT采用了多种稀疏性策略,并在损失函数中加入了去偏见的二阶项。此外,网络结构保持了与SparseGPT相似的基础架构,但在训练过程中引入了针对性的数据增强策略,以提高模型的公平性。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果显示,Debias-SparseGPT在不同稀疏性条件下均能有效降低剪枝引起的偏见,相较于SparseGPT,模型的困惑度和零-shot准确性保持不变。在最严格的2:4结构稀疏下,增加长上下文示例后,模型的下游性能和公平性均有显著提升,进一步验证了该方法的有效性。

🎯 应用场景

Debias-SparseGPT的研究成果在多个领域具有潜在应用价值,尤其是在需要高效且公平的自然语言处理任务中,如对话系统、内容生成和信息检索等。通过减少模型偏见,该方法能够提升用户体验,确保生成内容的公正性和多样性,进而影响未来的AI应用设计和伦理标准。

📄 摘要(原文)

Model compression techniques such as pruning and quantization facilitate the efficient deployment and acceleration of Large Language Models (LLMs). However, recent studies show that weight sparsification methods, such as SparseGPT, can amplify existing biases in models, with outputs varying significantly depending on persona cues in the prompt. In this paper, we introduce Debias-SparseGPT, a post-training pruning method incorporating representational debiasing using a second-order term defined over demographically contrasting inputs. We perform empirical validation of our method over a wide range of generative LLMs. Across models and sparsity regimes (25%, 50%, and structured 2:4 sparsity), Debias-SparseGPT consistently reduces pruning-induced bias compared to SparseGPT while preserving model perplexity and zero-shot accuracy. Under the most restrictive 2:4 structured sparsity pattern, which most aggressively degrades model quality, augmenting the calibration set with long-context, content-rich examples further improves both downstream performance and fairness. Overall, Debias-SparseGPT advances the bias-performance trade-off while preserving the computational efficiency of sparse models.