Confess What You Know: Forget-Set Misalignment with Model Knowledge in LLM Unlearning

📄 arXiv: 2609.00605v1 📥 PDF

作者: Miso Kim, Georu Lee, Seungwon Jeong, Woojin Lee

分类: cs.LG, cs.AI, cs.CL

发布日期: 2026-09-01

备注: Accepted to EMNLP 2026 (Main Conference). 22 pages, 3 figures


💡 一句话要点

提出CONFS框架以解决大语言模型的遗忘集不匹配问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大语言模型 机器遗忘 隐私保护 数据管理 模型效用

📋 核心要点

  1. 现有的大语言模型遗忘方法假设遗忘集与模型记忆信息一致,但在实际应用中常常失效,导致隐私泄露或效用下降。
  2. 本文提出CONFS框架,通过引导模型回忆其记忆知识,构建与模型对齐的遗忘集,从而解决遗忘集不匹配的问题。
  3. 实验结果显示,CONFS在合成、多模态和真实世界基准测试中表现优异,接近黄金标准,并在遗忘与效用之间取得良好平衡。

📝 摘要(中文)

大语言模型(LLMs)的机器遗忘通常假设预定义的遗忘集与模型记忆的信息相匹配,但在实际隐私设置中,这种假设常常失效。本文提出了遗忘集不匹配的概念,并识别了两种情况:在“欠遗忘”中,遗忘集遗漏了已记忆的信息,导致信息泄露;而在“超出知识遗忘”中,算法被迫“遗忘”模型从未学习的知识,扰动参数并降低效用。通过梯度级分析,本文表明这些行为源于不对齐的遗忘目标,而非特定的优化选择。为此,提出了CONfession-to-Forget-Set(CONFS)框架,通过引导和形式化模型的记忆知识,构建与模型对齐的遗忘集。实验结果表明,CONFS在多个基准测试中接近黄金标准表现,并在遗忘与效用之间实现了良好的平衡。

🔬 方法详解

问题定义:本文解决的是大语言模型在遗忘过程中遗忘集与模型记忆信息不匹配的问题。现有方法在隐私设置中常常失效,导致信息泄露或模型效用下降。

核心思路:论文的核心思路是通过引导模型回忆其记忆知识,构建与模型对齐的遗忘集。这种设计旨在减少遗忘过程中的信息损失和效用下降。

技术框架:CONFS框架包括两个主要模块:知识引导模块和遗忘集构建模块。知识引导模块负责从模型中提取记忆信息,而遗忘集构建模块则基于提取的信息生成遗忘集。

关键创新:最重要的技术创新点在于提出了遗忘集不匹配的概念,并通过数据盲方法构建与模型对齐的遗忘集,这与现有方法的依赖于具体数据的设计有本质区别。

关键设计:在设计中,CONFS采用了梯度级分析来识别不对齐的遗忘目标,并通过优化损失函数来确保遗忘集的有效性。具体的参数设置和网络结构细节在实验部分进行了详细描述。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,CONFS在多个基准测试中接近黄金标准表现,在遗忘与效用之间实现了良好的平衡。与其他数据盲遗忘集构建方法相比,CONFS在保持模型效用方面表现更佳,具体性能数据在实验部分提供。

🎯 应用场景

该研究的潜在应用领域包括隐私保护、数据管理和机器学习模型的安全性。通过有效的遗忘机制,能够在保护用户隐私的同时,确保模型的实用性和性能,具有重要的实际价值和未来影响。

📄 摘要(原文)

Machine unlearning for large language models (LLMs) often assumes that a pre-defined forget set matches what the model has memorized, but this frequently breaks in realistic privacy settings where the original training data is inaccessible. We term this gap forget-set misalignment and identify two cases. In Under Unlearning, the forget set omits memorized information and leakage persists. In Out-of-Knowledge Unlearning, the algorithm is driven to "forget" knowledge the model never learned, perturbing parameters and degrading utility. Using gradient-level analysis, we show these behaviors arise from misaligned unlearning targets rather than specific optimization choices. We then propose CONfession-to-Forget-Set (CONFS), a data-blind framework that constructs model-aligned forget sets by eliciting and formalizing the model's memorized knowledge. Across synthetic, multimodal, and real-world benchmarks, CONFS approaches Gold-standard performance on several metrics and achieves a competitive forgetting-utility balance, while preserving utility better than other data-blind forget-set constructions.