Exploring and Bridging Knowledge Holes in Unlearned Multimodal Large Language Models

📄 arXiv: 2608.01849v1 📥 PDF

作者: Junxiang You, Junkai Chen, Yuhao He, Ruiqi Liu, Zhetao Guo, Shu Wu

分类: cs.AI

发布日期: 2026-08-03


💡 一句话要点

提出选择性保护与锚定正则化以解决多模态大语言模型的知识缺失问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态大语言模型 机器遗忘 知识缺失 选择性保护 锚定正则化 模型评估 安全性

📋 核心要点

  1. 现有多模态大语言模型的遗忘评估方法未能有效捕捉知识缺失现象,导致模型在良性输入上的性能显著下降。
  2. 本文提出选择性保护与锚定正则化,通过锚定激活过滤保护通用模式,并通过实体抽象增强来强化这些模式。
  3. 实验结果显示,SPAR在响应质量上恢复了超过98%,而标准基线仅为50%,同时实现了0.00%的攻击成功率。

📝 摘要(中文)

机器遗忘为从多模态大语言模型中移除不安全内容提供了一种有前景的方法,但确保遗忘的精确性仍然是一个持续的挑战。现有的多模态大语言模型遗忘评估范式存在一个关键盲点:它们通过与遗忘集相距较远的基准评估模型效用,未能捕捉到知识缺失现象。为此,本文构建了一个基准,捕捉与遗忘集共享通用模式的良性输入上的意外降级,并通过控制实验确认这些降级是常用方法的系统性结果。此外,本文提出选择性保护与锚定正则化,旨在通过锚定激活过滤保护通用模式,同时通过实体抽象增强来强化它们。实验结果表明,SPAR在响应质量上恢复了超过98%的原始质量,而标准基线则低于50%。

🔬 方法详解

问题定义:本文旨在解决多模态大语言模型在遗忘过程中出现的知识缺失问题。现有方法在评估模型效用时,使用的基准与遗忘集相距较远,未能有效捕捉到良性输入上的性能降级。

核心思路:论文提出的选择性保护与锚定正则化(SPAR)方法,通过锚定激活过滤来保护通用模式,同时通过实体抽象增强来强化这些模式,从而有效减少知识缺失现象。

技术框架:SPAR的整体架构包括两个主要模块:锚定激活过滤模块和实体抽象增强模块。前者负责识别并保护通用模式,后者则通过增强策略来提升模型对这些模式的响应质量。

关键创新:SPAR的核心创新在于结合了锚定激活过滤和实体抽象增强两种策略,形成了一种新颖的保护机制,与现有方法相比,能够更有效地减少知识缺失现象。

关键设计:在技术细节上,SPAR采用了特定的损失函数来平衡保护与增强的效果,同时在网络结构中引入了锚定激活过滤层,以确保通用模式的有效保护。具体参数设置和网络结构设计在实验部分进行了详细描述。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,选择性保护与锚定正则化(SPAR)在响应质量上恢复了超过98%的原始质量,而标准基线仅为50%。此外,SPAR实现了0.00%的攻击成功率,显示出其在模型效用和安全性方面的显著优势。

🎯 应用场景

该研究的潜在应用领域包括安全内容过滤、智能助手和多模态交互系统等。通过提高多模态大语言模型的遗忘精确性,能够在保护用户隐私和安全的同时,提升模型的实用性和可靠性。未来,该方法可能在更多领域得到推广,推动智能系统的安全性和可信性。

📄 摘要(原文)

Machine unlearning offers a promising approach to remove unsafe content from Multimodal Large Language Models (MLLMs), yet ensuring the precision of unlearning remains a persistent challenge. One reason is that current MLLM unlearning evaluation paradigms suffer from a critical blind spot: they assess model utility through benchmarks whose representations are distant from the forget set, failing to capture knowledge holes---severe degradation on benign adjacent inputs. To probe knowledge holes in unlearned MLLMs, we construct a benchmark that captures unintended degradation on benign inputs sharing generic patterns with the forget set, and confirm through controlled experiments that they are a systematic consequence of commonly used approaches. Furthermore, to bridge this gap, we propose Selective Protection with Anchored Regularization, which protects generic patterns via anchored activation filtering while reinforcing them through entity-abstracted enhancement. Our experiments on SafeEraser demonstrate that SPAR recovers over 98% of vanilla response quality compared to below 50% for standard baselines---while achieving 0.00% attack success rate and competitive model utility. These results underscore the necessity of more fine-grained evaluation for trustworthy MLLM unlearning.