Unlearning Is Not Just Erasing: Temporal Decoupling via Generation Inequality
作者: Xunlei Chen, Qirui Ye, Yuang Li, Yi Gong, Zhaokun Wang, Wenyi Li, Shiyao Guo, Jinyu Guo
分类: cs.CL, cs.AI
发布日期: 2026-08-24
💡 一句话要点
提出ADU框架以解决大语言模型的有效遗忘问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大语言模型 隐私保护 有效遗忘 上下文解耦 注意力机制 自然语言处理 模型效用
📋 核心要点
- 现有方法在实现精确遗忘时,往往会影响模型的整体效用,难以平衡隐私与性能之间的关系。
- 本文提出的ADU框架通过上下文注意力路径的解耦,避免了传统方法对语言结构的破坏,提升了遗忘的精度。
- ADU在TOFU基准测试中取得了0.93的Forget Quality,模型效用保持在92.9%,显著优于基线方法的81.9%。
📝 摘要(中文)
大语言模型(LLMs)需要有效的遗忘机制以应对隐私法规和安全问题。然而,在不影响模型整体效用的前提下实现精确遗忘仍然具有挑战性。现有的序列和标记级方法在没有建模上下文依赖的检索路径的情况下惩罚目标输出,这可能会破坏语言结构或抑制良性知识。本文提出了ADU,一个细粒度的基于训练的框架,将遗忘从标记擦除转变为上下文注意力路径的解耦。ADU利用局部和全局注意力头之间的功能区别,识别出检索持久敏感锚点的预设位置,并修正其候选路径。经过训练的注意力投影适配器能够在这些路径上抑制注意力质量,同时保留局部注意力结构和语言建模。ADU在TOFU和WMDP基准测试中表现出色,Forget Quality达到0.93,同时保持87-98%的模型效用。
🔬 方法详解
问题定义:本文旨在解决大语言模型在满足隐私法规时的有效遗忘问题。现有方法往往通过简单的标记擦除来实现遗忘,但这会破坏模型的语言结构和整体效用。
核心思路:ADU框架的核心思路是将遗忘过程从简单的标记擦除转变为上下文注意力路径的解耦。通过识别和修正敏感信息的检索路径,ADU能够在保留模型效用的同时实现有效的遗忘。
技术框架:ADU的整体架构包括几个主要模块:首先,识别出敏感锚点的预设位置;其次,修正这些位置的候选路径;最后,训练注意力投影适配器以抑制这些路径上的注意力质量。
关键创新:ADU的创新点在于利用局部和全局注意力头的功能区别,进行上下文路径的解耦。这一方法与现有的简单标记擦除方法本质上不同,能够更有效地实现遗忘而不损害模型的语言能力。
关键设计:在设计中,ADU采用了特定的损失函数来平衡注意力抑制与语言建模的保留,同时在训练过程中调整注意力头的参数设置,以确保局部注意力结构的完整性。
🖼️ 关键图片
📊 实验亮点
在实验中,ADU在TOFU基准测试中取得了0.93的Forget Quality,显著优于基线方法的81.9%。同时,ADU在保持87-98%模型效用的情况下,展现出更低的副作用,显示出其在实际应用中的优越性。
🎯 应用场景
该研究的潜在应用领域包括需要遵循隐私法规的自然语言处理任务,如社交媒体内容生成、客户服务对话系统等。通过有效的遗忘机制,ADU能够在保护用户隐私的同时,保持模型的高效性和准确性,具有重要的实际价值和未来影响。
📄 摘要(原文)
Large language models (LLMs) require effective unlearning to address privacy regulations and safety concerns. However, achieving precise forgetting without compromising general utility remains challenging. Existing sequence- and token-level methods penalize target outputs without modeling their context-dependent retrieval paths, which can disrupt linguistic structure or suppress benign knowledge. We present ADU, a fine-grained, training-based framework that shifts unlearning from token erasure to contextual attention-pathway decoupling. Exploiting the functional distinction between local and global attention heads, ADU identifies preplan positions that retrieve persistent sensitive anchors and fixes their candidate paths under the original model. It then trains attention-projection adapters to suppress attention mass along these paths while preserving local-attention structure and retain-set language modeling. Post-training activation exchange tests whether the modified attention-output module transmits the learned forgetting effect. ADU achieves the strongest aggregate performance among evaluated baselines on the TOFU and WMDP benchmarks, including a Forget Quality of (0.93) on TOFU. It preserves 87--98% of model utility (92.9% on average versus 81.9% for baselines) while reducing side effects in benign contexts.