How Perturbations Propagate: A Multi-Level Analysis of Robustness in Large Language Models
作者: Dun Li Chan, Emily Liu, Niyathi Allu, Christian Hoang
分类: cs.CL, stat.ML
发布日期: 2026-09-03
备注: 12 pages, 4 figures
💡 一句话要点
提出多层次分析方法以评估大语言模型的鲁棒性
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 语言模型 鲁棒性评估 多层次分析 扰动传播 GPT-2 注意力机制 隐藏状态几何
📋 核心要点
- 现有的鲁棒性评估方法通常只关注输出行为,忽视了隐藏状态和注意力机制的变化。
- 本文提出了一种多层次分析方法,评估扰动在输出行为、隐藏状态几何和注意力头功能上的传播。
- 实验结果显示,扰动类型的度量特征在不同检查点间存在差异,强调了多层次评估的重要性。
📝 摘要(中文)
语言模型在面对拼写错误、文本损坏、单词变化和令牌顺序干扰时,其鲁棒性通常仅通过输出行为进行评估。本文研究了六种自然和合成输入扰动如何在解码器语言模型中传播,分析了输出行为、隐藏状态几何和注意力头功能三个层面。通过对四个GPT-2和两个Qwen2.5检查点的行为影响进行评估,利用中心核对齐和内在维度分析层级几何,并检查GPT-2中的注意力头响应。结果表明,扰动类型产生的度量特征在输出度量中未被完全捕捉,并且在测试的检查点中仅部分一致。我们的研究表明,基于单一行为或表征度量的鲁棒性声明可能具有误导性,促使对扰动如何改变语言模型计算进行多层次评估。
🔬 方法详解
问题定义:本文旨在解决现有语言模型鲁棒性评估方法的不足,特别是仅依赖输出行为的评估方式,未能全面反映模型的内部状态和机制。
核心思路:通过多层次分析,研究扰动如何影响语言模型的输出、隐藏状态几何和注意力头功能,提供更全面的鲁棒性评估。
技术框架:研究分为三个主要层面:输出行为评估、隐藏状态几何分析(使用中心核对齐和内在维度)以及注意力头功能分析,结合多种扰动类型进行综合评估。
关键创新:提出了基于多层次的鲁棒性评估方法,强调了不同扰动类型在模型内部表现的差异,挑战了传统的单一输出评估方法。
关键设计:在实验中,使用了六种自然和合成扰动类型,分析了四个GPT-2和两个Qwen2.5检查点的表现,特别关注了激活补丁恢复和梯度引导的HotFlip扰动对模型行为的影响。
🖼️ 关键图片
📊 实验亮点
实验结果表明,使用梯度引导的HotFlip扰动在GPT-2中引起的行为和表征干扰显著强于随机令牌替换,且在六个测试检查点中表现一致。此外,扰动类型的度量特征在不同模型间存在显著差异,强调了多层次评估的重要性。
🎯 应用场景
该研究的潜在应用领域包括自然语言处理中的模型鲁棒性评估、对抗样本生成以及模型优化。通过更全面的评估方法,可以提升语言模型在实际应用中的可靠性,尤其是在处理噪声和不确定输入时的表现。未来可能推动更智能的对抗训练和模型设计。
📄 摘要(原文)
Language models encounter typos, corrupted text, altered words, and disrupted token order, yet robustness is usually evaluated only through output behavior. We study how six naturalistic and synthetic input perturbations propagate through decoder-only language models at three levels: output behavior, hidden-state geometry, and attention-head function. We evaluate behavioral effects across four GPT-2 and two Qwen2.5 checkpoints by analyzing layerwise geometry using centered kernel alignment and intrinsic dimension, and examine attention-head responses in GPT-2. Perturbation types produce distinguishable metric profiles that are not fully captured by output measures and are only partly consistent across the tested checkpoints. Copying scores are especially associated with activation-patching recovery under token substitution and shuffling. Gradient-guided HotFlip perturbations also cause stronger behavioral and representational disruption than rate-matched random token substitutions in GPT-2; their behavioral effects are consistent across all six tested checkpoints. Our results show that robustness claims based on a single behavioral or representational metric can be misleading, and motivate multi-level evaluation of how perturbations alter language-model computation.