Jacobian-guided Noise Injection for Quantization Robustness in Large Language Models
作者: Deepanshu Pandey, Arnav Chavan, Nahush Lele, Sankalp Dayal, Deepak Gupta
分类: cs.LG, cs.AI
发布日期: 2026-08-21
备注: Accepted at AdaptFM: Resource-Adaptive Foundation Model Inference, ICML 2026
💡 一句话要点
提出雅可比引导噪声注入以增强大语言模型的量化鲁棒性
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 量化鲁棒性 大语言模型 雅可比引导 噪声注入 自注意力机制 高斯噪声 性能优化
📋 核心要点
- 现有方法在大语言模型的量化过程中,容易受到自注意力机制对离散化误差的敏感性影响,导致性能下降。
- 论文提出了一种雅可比引导噪声注入的训练策略,通过将高斯噪声注入到预注意力logits中,以抑制雅可比范数。
- 实验结果表明,该方法在多个最先进的LLM架构上表现出更好的鲁棒性,Top-1准确率和相对困惑度均有显著提升。
📝 摘要(中文)
大语言模型(LLMs)的量化常常受到自注意力机制对离散化误差的敏感性影响。我们识别出softmax操作是量化稳定性的瓶颈,因其对异常值和状态相关雅可比的敏感性。我们理论上证明,抑制该雅可比的范数有助于限制量化引起的性能下降。基于此,我们提出了雅可比引导噪声注入,这是一种训练策略,通过将零均值高斯噪声注入到预注意力logits中,噪声方差直接来源于雅可比的Frobenius范数。与依赖启发式或直接惩罚雅可比的先前方法不同,我们的方法提供了一种基于局部注意力敏感性识别最佳噪声方差的方式。我们在最先进的LLM架构上评估了该方法,结果显示其在流行的PTQ方法上表现出更好的鲁棒性。实证分析表明,该方法在ImageNet-1K的Top-1准确率上相较于SigLIP提高了最高37%的相对增益,并在低比特量化设置下提高了WikiText语言模型的相对困惑度最高达40%,证明了该方法的有效性。
🔬 方法详解
问题定义:论文要解决的问题是大语言模型在量化过程中,由于自注意力机制对离散化误差的敏感性,导致性能下降。现有方法往往依赖启发式或直接惩罚雅可比,缺乏有效的噪声方差选择机制。
核心思路:论文的核心思路是通过抑制雅可比的范数,来限制量化引起的性能下降。具体而言,采用零均值高斯噪声注入策略,噪声方差基于雅可比的Frobenius范数进行计算,以增强模型的鲁棒性。
技术框架:整体架构包括数据预处理、噪声注入模块和模型训练阶段。首先对输入数据进行处理,然后在预注意力logits中注入噪声,最后进行模型训练以优化性能。
关键创新:最重要的技术创新点在于提出了雅可比引导噪声注入策略,能够根据局部注意力敏感性动态调整噪声方差,与传统方法相比,提供了更为精确的噪声控制机制。
关键设计:在参数设置上,噪声的方差是通过计算雅可比的Frobenius范数得出的,损失函数设计上考虑了量化误差的影响,网络结构上保持了原有的LLM架构,确保了方法的兼容性与有效性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,提出的方法在ImageNet-1K数据集上,Top-1准确率相较于SigLIP提高了最高37%,在WikiText数据集上,低比特量化设置下相对困惑度提高了最高40%。这些结果表明该方法在量化鲁棒性方面的显著提升。
🎯 应用场景
该研究的潜在应用领域包括自然语言处理、计算机视觉等需要高效量化的大型模型。通过增强模型在量化过程中的鲁棒性,可以在资源受限的环境中实现更高效的推理,具有重要的实际价值和广泛的应用前景。
📄 摘要(原文)
Quantization of Large Language Models (LLMs) is often hindered by the sensitivity of the self-attention mechanism to discretization errors. We identify the softmax operator as a bottleneck for quantization stability due to its sensitivity to outliers and state-dependent Jacobian. We theoretically establish that suppressing the norm of this Jacobian helps in bounding quantization-induced performance degradation. Based on this, we propose Jacobian-Guided Noise Injection, a training strategy that injects zero-mean Gaussian noise into pre-attention logits, with variance derived directly from the Jacobian Frobenius norm. Unlike prior approaches that rely on heuristic or penalise jacobian directly, our method provides a way to identify the optimal noise variance based on the local attention sensitivity. We evaluate the method on SOTA LLM architectures, where it demonstrates improved robustness over popular PTQ methods. Empirical analysis reveals that the proposed method gives up to +37% relative gains on Top-1 accuracy on ImageNet-1K for SigLIP and improves relative perplexity by upto 40% on WikiText for language models in low bit quantisation settings, proving the efficacy of the approach.