GRACE:Gradient-guided Coreset Selection for LLM Unlearning
作者: Praveen Bushipaka, Andrea D'Angelo, Lucia Passaro, Tommaso Cucinotta
分类: cs.AI, cs.LG
发布日期: 2026-08-28
备注: 20 pages, 16 tables, 5 figures, accepted to EMNLP Findings
💡 一句话要点
提出GRACE以解决大语言模型的遗忘与保留数据选择问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 机器遗忘 大语言模型 梯度选择 数据选择 模型优化
📋 核心要点
- 现有的大语言模型遗忘方法通常依赖于预设的遗忘和保留集合,缺乏灵活性,难以应对实际应用中的多样化请求。
- 本文提出的GRACE方法通过梯度引导选择遗忘和保留集合,能够有效推断出所需的数据集,提升模型的遗忘能力。
- 实验结果显示,GRACE在多个领域和模型上均能提高模型效用,同时保持遗忘质量,优于传统的梯度选择方法。
📝 摘要(中文)
大语言模型的机器遗忘方法通常假设存在预先指定的遗忘和保留集合。然而,在实际场景中,用户请求可能仅提供少量不希望出现的行为示例,导致需要从异构语料中推断遗忘和保留集合。为此,本文提出了GRACE,一种基于梯度引导的核心集选择方法,构建大语言模型的遗忘和保留集合。GRACE首先从引发不希望行为的种子示例中计算遗忘方向,然后使用非负正交匹配追踪选择一个紧凑的遗忘核心集,其梯度近似该方向。为了保持模型效用,GRACE在投影出遗忘方向后,在剩余的梯度空间中应用聚类正交匹配追踪选择保留示例。实验结果表明,GRACE在两个目标领域、两个模型家族和四种遗忘算法上均提高了模型效用,同时保持了可比的遗忘质量,尤其在梯度选择方法上表现出一致的提升。
🔬 方法详解
问题定义:本文旨在解决大语言模型在机器遗忘过程中,如何从有限的示例中有效推断出遗忘和保留集合的问题。现有方法往往假设用户提供完整的遗忘和保留集合,缺乏对实际应用场景的适应性。
核心思路:GRACE方法的核心在于利用梯度信息引导选择遗忘和保留集合。通过计算遗忘方向并选择与之相近的核心集,GRACE能够在保持模型效用的同时,有效地实现遗忘。
技术框架:GRACE的整体流程包括两个主要阶段:首先,从种子示例中计算遗忘方向;其次,在投影出遗忘方向后,应用聚类正交匹配追踪选择保留示例。
关键创新:GRACE的创新之处在于其梯度引导的核心集选择方法,能够在复杂的异构数据中有效推断出遗忘和保留集合,显著提升了模型的遗忘效果和实用性。
关键设计:在GRACE中,采用非负正交匹配追踪来选择遗忘核心集,并在剩余的梯度空间中使用聚类正交匹配追踪选择保留示例。这些设计确保了所选示例的有效性和模型的整体性能。
🖼️ 关键图片
📊 实验亮点
在实验中,GRACE在两个目标领域和两个模型家族上均表现出色,显著提高了模型的效用,同时保持了遗忘质量。与传统的梯度选择方法相比,GRACE在多个实验设置中均展现出一致的性能提升,具体提升幅度未知。
🎯 应用场景
GRACE方法在大语言模型的机器遗忘领域具有广泛的应用潜力,尤其适用于需要快速响应用户反馈的场景,如社交媒体内容管理、个性化推荐系统等。通过有效地选择遗忘和保留数据,GRACE能够帮助模型更好地适应用户需求,提升用户体验。未来,该方法还可能扩展到其他机器学习领域,促进模型的动态更新与优化。
📄 摘要(原文)
Machine Unlearning methods for Large Language Models typically assume pre-specified forget and retain sets. In realistic settings, however, requests may provide only a few examples of undesired behavior, requiring forget and retain sets to be inferred from heterogeneous corpora. We study this data-selection problem and propose GRACE , a gradient-guided coreset selection method that constructs both forget and retain sets for LLM unlearning. GRACE first computes a forget direction from seed examples that elicit the undesired behavior, then selects a compact forget coreset whose gradients approximate this direction using non-negative orthogonal matching pursuit. To preserve model utility, it selects retain examples after projecting out the forget direction and applying clustered orthogonal matching pursuit in the remaining gradient space. Across two target domains, two model families, and four unlearning algorithms, GRACE improves model utility while maintaining comparable forget quality, with particularly consistent gains over prior gradient-based selection methods.