Noise-Aware Shrinkage for Differentially Private Zeroth-Order Fine-Tuning of Large Language Models

📄 arXiv: 2608.03277v1 📥 PDF

作者: Lele Zheng, Weifeng Kong, Xinyi Zhang, Ke Cheng, Tao Zhang, Yulong Shen

分类: cs.LG, cs.CR

发布日期: 2026-08-04


💡 一句话要点

提出SAGE方法以解决差分隐私下大语言模型微调中的噪声问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 差分隐私 零阶优化 大语言模型 噪声感知 模型微调 信号处理 机器学习

📋 核心要点

  1. 现有的差分隐私零阶优化方法在固定尺度下重构模型更新,未能有效处理训练过程中信号强度的变化,导致噪声主导的更新影响模型性能。
  2. 本文提出的SAGE方法通过自适应减弱噪声主导的更新,利用信号质量的估计来优化模型更新过程,提升了微调效果。
  3. 实验结果显示,SAGE在RoBERTa-large、OPT-1.3B和OPT-6.7B模型上,在相同隐私预算下超越了大多数现有基线,证明了其有效性。

📝 摘要(中文)

差分隐私零阶优化(DP-ZO)使得大语言模型的私有微调变得高效,但现有的聚合方法在固定尺度下重构模型更新,忽视了训练过程中有用信号的强度变化,导致噪声主导的更新可能受到过度权重,从而降低模型效用。为了解决这一问题,本文提出了SAGE,一种噪声感知的收缩方法,根据估计的信号质量自适应地减弱私有化估计。SAGE通过从观察到的二阶矩中减去已知的高斯噪声方差来估计潜在的信号能量,并通过时间跟踪来稳定这一估计,比较当前的信噪比与预热参考以推导出有界的收缩因子。作为纯后处理,SAGE不需要额外的隐私预算或模型查询,仅引入常量额外状态。理论分析表明,收缩可以更快地减少二次更新风险项,同时限制噪声主导更新的影响。实验结果表明,SAGE在相同隐私预算下在大多数设置中优于现有基线,同时保持DP-ZO的前向内存效率。

🔬 方法详解

问题定义:本文旨在解决差分隐私零阶优化(DP-ZO)中噪声主导更新对模型性能的负面影响。现有方法在固定尺度下重构模型更新,未能考虑训练过程中信号强度的变化,导致噪声影响过大。

核心思路:SAGE方法通过自适应地减弱噪声主导的更新,利用信号质量的估计来优化模型更新过程。通过减去已知的高斯噪声方差,SAGE能够更准确地估计潜在的信号能量,从而提升模型的微调效果。

技术框架:SAGE的整体架构包括信号能量估计、时间跟踪和信噪比比较三个主要模块。首先,通过观察到的二阶矩减去噪声方差来估计信号能量;其次,利用时间跟踪稳定这一估计;最后,比较当前信噪比与预热参考以推导出收缩因子。

关键创新:SAGE的主要创新在于其噪声感知的收缩机制,能够根据信号质量自适应调整更新权重。这一方法与现有的固定尺度聚合方法本质上不同,能够更有效地处理噪声影响。

关键设计:SAGE的设计包括对已知高斯噪声方差的减去、信号能量的时间跟踪以及信噪比的动态比较。通过这些设计,SAGE能够在不增加额外隐私预算或模型查询的情况下,优化模型更新过程。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,在RoBERTa-large、OPT-1.3B和OPT-6.7B模型上,SAGE在相同隐私预算下的性能普遍优于现有基线,尤其在噪声主导的更新场景中,SAGE显著提升了模型的有效性和鲁棒性。

🎯 应用场景

该研究的潜在应用领域包括自然语言处理、对话系统和个性化推荐等。通过提升大语言模型在差分隐私条件下的微调效果,SAGE方法能够在保护用户隐私的同时,提供更高质量的模型服务,具有重要的实际价值和未来影响。

📄 摘要(原文)

Differentially private zeroth-order optimization (DP-ZO) enables memory-efficient private fine-tuning of large language models using only forward evaluations. Existing aggregation-based DP-ZO methods reconstruct model updates at a fixed scale, ignoring that the strength of useful signals varies throughout training. Consequently, noise-dominated updates may receive excessive weight and degrade model utility. To address this issue, we propose SAGE, a noise-aware shrinkage method that adaptively attenuates privatized estimates according to their estimated signal quality. SAGE subtracts the known Gaussian noise variance from the observed second moment to estimate the underlying signal energy, stabilizes this estimate through temporal tracking, and compares its current signal-to-noise level with a warm-up reference to derive a bounded shrinkage factor. As pure post-processing, SAGE requires neither additional privacy budget nor model queries and introduces only constant additional state. Our theoretical analysis shows that shrinkage reduces the quadratic update-risk term faster than the linear descent term, preserving useful descent while limiting the influence of noise-dominated updates. Experiments on RoBERTa-large, OPT-1.3B, and OPT-6.7B demonstrate that SAGE outperforms existing baselines in most settings under the same privacy budgets while preserving the forward-only memory efficiency of DP-ZO.