Masking Is Not Enough: Generative Restoration for Multimodal De-Identification in Medical AI
作者: Shiva Shrestha, Zongxing Xie, Chen Zhao, Liran Ma, Zhipeng Cai, Honghui Xu
分类: cs.CV, cs.CR
发布日期: 2026-08-21
💡 一句话要点
提出ClinX框架以解决医疗AI中的多模态去标识化问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 医疗AI 去标识化 多模态数据 隐私保护 光学字符识别 生成恢复 临床应用
📋 核心要点
- 现有的医疗图像-文本数据去标识化方法往往无法有效保护受保护的健康信息,尤其是在多模态系统中。
- ClinX框架通过光学字符识别(OCR)检测标识符,并结合生成恢复模块和渐进式去标识化策略,提供了一种新的解决方案。
- 实验结果显示,ClinX在医疗视觉问答任务中显著降低了PHI泄露,同时保持了下游任务的效用。
📝 摘要(中文)
医疗图像-文本数据可能通过可见的图像内容和伴随的文本暴露受保护的健康信息(PHI),这对隐私保护的医疗AI系统构成障碍。现有的医疗视觉-语言基准主要强调任务效用,而去标识化方法往往与下游推理分开评估。本文提出ClinX,一个端到端的多模态PHI清理框架,能够检测可见标识符并构建二进制PHI掩码,同时通过渐进式去标识化减少文本侧的PHI。实验结果表明,单靠光学字符识别(OCR)掩码不足以作为独立解决方案,而基于恢复的去标识化方法在保留临床相关视觉上下文的同时显著减少可恢复的PHI。
🔬 方法详解
问题定义:本文旨在解决医疗图像-文本数据中受保护健康信息(PHI)的去标识化问题。现有方法如OCR掩码无法有效保护PHI,尤其在多模态系统中,信息泄露风险较高。
核心思路:ClinX框架通过检测可见标识符并构建二进制PHI掩码,结合生成恢复模块和渐进式去标识化,提供了一种综合的PHI清理方案。此设计旨在在去标识化的同时保留临床相关的视觉上下文。
技术框架:ClinX的整体架构包括三个主要模块:1) OCR模块用于检测图像中的标识符;2) ClinX-PRISM生成恢复模块用于隐私导向的后处理;3) 文本侧的渐进式去标识化策略,包括正则表达式掩码、上下文感知掩码和重写基础的清理。
关键创新:ClinX的主要创新在于结合了生成恢复与渐进式去标识化策略,显著提高了PHI清理的有效性,尤其是在多模态数据中。与现有方法相比,ClinX能够更好地保留临床相关信息。
关键设计:ClinX的设计包括使用光学字符识别(OCR)进行标识符检测,采用无跳过的生成恢复模块ClinX-PRISM,并在文本侧实施多层次的去标识化策略。损失函数和网络结构的具体细节在论文中进行了详细描述。
🖼️ 关键图片
📊 实验亮点
实验结果表明,ClinX在医疗视觉问答任务中显著降低了PHI泄露,OCR单独掩码的效果不佳,而基于恢复的去标识化方法在保留视觉上下文的同时,减少了可恢复的PHI,提升幅度明显。
🎯 应用场景
ClinX框架在医疗AI领域具有广泛的应用潜力,尤其是在需要保护患者隐私的医疗图像和文本数据处理场景中。其有效的去标识化能力可以促进医疗数据的共享与利用,同时确保患者隐私得到保护,推动医疗AI的安全发展。
📄 摘要(原文)
Medical image-text data can expose protected health information (PHI) through both visible image content as well as accompanying text, creating a barrier to privacy-preserving medical AI systems. This risk is especially prominent in multimodal systems, where images, questions, reports, and clinical context may enter training, evaluation, or inference pipelines. Existing medical vision-language benchmarks primarily emphasize task utility, while de-identification methods are often evaluated separately from downstream reasoning. We introduce ClinX, an end-to-end multimodal PHI sanitization framework for medical image-text data. ClinX detects visible identifiers with optical character recognition (OCR), constructs binary PHI masks, and applies ClinX-PRISM, a no-skip generative restoration module with privacy-oriented post-processing for burned-in identifier suppression. In parallel, text-side PHI is reduced through progressive de-identification levels: regex masking, context-aware masking, and rewrite-based sanitization. We evaluate ClinX in medical visual question answering (MedVQA), jointly measuring PHI leakage and downstream utility across image-side, text-side, and combined de-identification settings. Results show that OCR-only masking is not sufficient as a standalone solution, and restoration-based sanitization better preserves clinically relevant visual context while sharply reducing recoverable PHI.