SAUL: Sharpness-Aware Augmented-Lagrangian Unlearning
作者: Jaewan Choi, Junyoung Yang, Sangdon Park
分类: cs.LG
发布日期: 2026-08-17
备注: 9 pages
💡 一句话要点
提出SAUL以解决大语言模型中的机器遗忘问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 机器遗忘 大语言模型 增强拉格朗日 优化方法 知识管理 隐私保护 模型更新
📋 核心要点
- 现有的机器遗忘方法在抹除特定知识与保持模型效用之间存在显著的权衡挑战。
- SAUL通过将遗忘形式化为显式约束的最小化问题,提出了一种新的解决方案,强调适度遗忘的必要性。
- 实验结果表明,SAUL在多个基准测试中优于传统方法,展现了更好的遗忘与效用平衡。
📝 摘要(中文)
在大语言模型(LLMs)中,机器遗忘面临着抹除目标知识与保持一般效用之间的关键权衡。我们提出SAUL(Sharpness-Aware Augmented-Lagrangian Unlearning),将遗忘问题形式化为一个约束最小化问题,遵循“遗忘足够,但不多于必要”的原则。SAUL的核心在于将遗忘作为一个显式约束进行定义,而以往的方法通常通过优化目标隐式指定遗忘水平。增强拉格朗日控制器根据约束违反情况自适应调整遗忘压力,并在满足约束标准时最终停用遗忘更新。通过对保留和遗忘目标进行敏感性更新,以及采用角色分离的双优化器设计,进一步稳定了遗忘动态。我们在TOFU、WMDP和MUSE基准上评估SAUL,展示了在基准特定遗忘标准下,相较于代表性的敏感性和扰动基线,SAUL在遗忘与效用之间的良好权衡。除了完整的SAUL框架外,我们还在TOFU上展示了将增强拉格朗日控制器作为基线的改进器应用,提升了其遗忘后的效用,证明了显式遗忘控制的实际价值。
🔬 方法详解
问题定义:本论文旨在解决大语言模型中的机器遗忘问题,现有方法往往隐式指定遗忘水平,导致遗忘效果不理想,且难以控制遗忘的程度。
核心思路:SAUL通过将遗忘定义为显式约束,采用增强拉格朗日方法进行优化,确保遗忘过程既有效又可控,避免过度遗忘。
技术框架:SAUL的整体架构包括约束最小化模块、增强拉格朗日控制器和双优化器设计。约束最小化模块负责遗忘目标的定义,控制器根据约束违反情况调整遗忘压力,双优化器则确保保留和遗忘目标的角色分离。
关键创新:SAUL的主要创新在于显式遗忘约束的引入,与以往隐式优化目标的遗忘方法本质上不同,提供了更高的控制精度和灵活性。
关键设计:在技术细节上,SAUL设计了适应性遗忘压力的增强拉格朗日控制器,并在损失函数中引入了敏感性更新机制,以提高遗忘过程的稳定性和效率。
🖼️ 关键图片
📊 实验亮点
在TOFU、WMDP和MUSE基准测试中,SAUL展示了优于传统敏感性和扰动基线的方法,具体表现为在遗忘与效用之间实现了更优的权衡,提升幅度显著,尤其是在满足特定遗忘标准的情况下,SAUL的表现更为突出。
🎯 应用场景
SAUL的研究成果在多个领域具有潜在应用价值,尤其是在需要对模型进行知识更新或删除的场景,如隐私保护、合规性要求和动态知识管理等。通过提供有效的遗忘控制,SAUL能够帮助企业和研究机构更好地管理其模型的知识库,确保合规性和安全性。
📄 摘要(原文)
Machine unlearning in Large Language Models (LLMs) faces a critical trade-off between erasing target knowledge and preserving general utility. We propose SAUL (Sharpness-Aware Augmented-Lagrangian Unlearning), which formulates unlearning as a constrained minimization problem following the principle of "forget enough, but no more than necessary." At its core, SAUL formulates forgetting as an explicit constraint with a prescribed satisfaction criterion, whereas prior unlearning methods typically specify the desired level of forgetting implicitly through optimization objectives. An augmented Lagrangian controller adaptively adjusts forget-side pressure according to constraint violation and can eventually deactivate the forget-side update as the prescribed criterion remains satisfied. Sharpness-aware updates on both retain and forget objectives, together with a dual-optimizer design that maintains role-separated states, further stabilize the resulting unlearning dynamics. We evaluate SAUL on the TOFU, WMDP, and MUSE benchmarks, demonstrating favorable forgetting-utility trade-offs over representative sharpness- and perturbation-based baselines under benchmark-specific forgetting criteria. Beyond the complete SAUL framework, we further show on TOFU that applying the augmented-Lagrangian controller as a drop-in modifier to representative baselines improves their post-forgetting utility, demonstrating the practical value of explicit forgetting control.