Where Identity Lives: Localized, Retain-Free Identity Unlearning in Multimodal Large Language Models

📄 arXiv: 2608.30649v1 📥 PDF

作者: Kangwook Ko, Jaehyuk Jang, Wonjun Lee, Hee-Seon Kim, Changick Kim

分类: cs.CL, cs.CV

发布日期: 2026-08-31

备注: Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026


💡 一句话要点

提出PAVA方法以解决多模态大语言模型中的身份信息删除问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态大语言模型 身份信息删除 隐私保护 路径感知 视觉属性锚定 遗忘损失 模型更新 计算机视觉

📋 核心要点

  1. 现有方法在删除多模态大语言模型中的个体信息时,依赖于难以获取的保留集,导致隐私风险。
  2. 本文提出路径感知视觉属性锚定(PAVA),将身份信息的删除限制在特定的解码器层,避免对视觉计算的干扰。
  3. 实验结果显示,PAVA在遗忘-保留权衡方面优于仅依赖遗忘集的方法,并与基于保留的基线方法相当。

📝 摘要(中文)

在多模态大语言模型(MLLMs)中,删除特定个体信息的需求在部署后常常出现,但现有方法依赖于难以获取的保留集,重建保留集又会重新暴露隐私。仅从遗忘集中删除信息会损害共享的视觉-语言计算,影响感知。本文将无保留遗忘视为一个定位问题,提出路径感知视觉属性锚定(PAVA),该方法将更新限制在特定层,并通过遗忘损失与视觉属性锚定相结合,保持图像基础行为。实验结果表明,PAVA在MLLMU-Bench和ReMem上表现出最佳的遗忘-保留权衡,且与基于保留的基线方法具有竞争力。

🔬 方法详解

问题定义:本文解决在多模态大语言模型中删除特定个体信息的难题。现有方法依赖保留集,难以获取且重建会导致隐私暴露,而仅从遗忘集中删除信息会损害模型的视觉-语言计算能力。

核心思路:论文的核心思路是将无保留遗忘视为一个定位问题,识别出存储身份信息的解码器中层,并在不显著干扰视觉计算的情况下进行修改。通过路径感知视觉属性锚定(PAVA),将更新限制在这些层,并结合遗忘损失与视觉属性锚定,保持模型的图像基础行为。

技术框架:整体架构包括识别存储身份信息的解码器中层、设计遗忘损失与视觉属性锚定的结合、以及在MLLMU-Bench和ReMem数据集上进行的实验验证。主要模块包括身份信息定位、损失函数设计和模型更新策略。

关键创新:最重要的技术创新在于将无保留遗忘视为定位问题,并提出PAVA方法,能够在不依赖保留集的情况下有效删除身份信息,同时保持模型的视觉-语言计算能力。与现有方法相比,PAVA在处理身份信息时具有更高的灵活性和安全性。

关键设计:在PAVA中,损失函数结合了遗忘损失和视觉属性锚定,确保模型在遗忘过程中仍能保持对图像的理解。网络结构上,重点修改解码器中的中层,避免对其他模块的干扰。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,PAVA在MLLMU-Bench和ReMem数据集上实现了最佳的遗忘-保留权衡,相较于仅依赖遗忘集的方法,性能显著提升,并与基于保留的基线方法保持竞争力,展示了其有效性和实用性。

🎯 应用场景

该研究的潜在应用领域包括社交媒体、在线服务和任何需要保护用户隐私的多模态系统。通过有效删除个体信息,PAVA方法能够增强用户信任,降低隐私泄露风险,具有重要的实际价值和未来影响。

📄 摘要(原文)

Removing a specific individual's information from multimodal large language models (MLLMs) is often needed after deployment, but existing methods rely on a retain set, which is hardest to obtain at that point, and rebuilding it recreates the privacy exposure that unlearning aims to remove. Forgetting from the forget set alone instead damages the shared visual-language computation, harming perception. We cast retain-free unlearning as a localization problem: causal tracing, weight transplant, and Fisher overlap all point to early-to-mid decoder MLPs as the layers where identity information is stored and, unlike other module families, can be modified without substantially disrupting vision. We turn this into Pathway-Aware Visual-attribute Anchoring (PAVA), which confines updates to these layers and pairs a forget loss with a visual-attribute anchor that preserves image-grounded behavior by distilling the model's own pre-unlearning answers from the forget images alone. On MLLMU-Bench and ReMem, PAVA gives the strongest forget-retain trade-off among forget-set-only methods and remains competitive with retain-based baselines.