MIND: Multimodal Intent-Driven Network via Diffusion Transformers for Medical Image Fusion
作者: Yunzhan Fu, Xiangyu Shen, Yifei Sun, Yuhan Chen, Jian Wu, Hongxia Xu
分类: cs.CV
发布日期: 2026-07-30
备注: 14pages, 14 figures, accepted by ACM MM2026
💡 一句话要点
提出MIND以解决医学图像融合中的意图驱动问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态融合 医学图像处理 意图驱动 扩散变换器 深度学习 临床决策支持 语义一致性
📋 核心要点
- 现有医学图像融合方法缺乏对诊断意图和病理结构的深入理解,导致融合效果不佳。
- MIND通过生成意图驱动的融合文本,结合多尺度潜在适配器和医学语义一致性损失,提升融合质量。
- 在Harvard、BraTS和GFP数据集上,MIND显著提高了融合质量和脑肿瘤分割准确性,展示了良好的应用前景。
📝 摘要(中文)
医学图像融合旨在整合来自不同成像模态的互补信息,以支持临床诊断。现有方法通常在全局应用统一的融合规则,缺乏对诊断意图和病理结构的深刻理解。为了解决这些局限性,本文提出了MIND,一个基于扩散变换器的多模态意图驱动网络。通过BioMedGPT生成意图驱动的融合文本,指导融合过程。设计的多尺度潜在适配器有效提取源图像特征,确保图像特征的维度对齐。此外,医学语义一致性损失确保融合图像与融合文本之间的深层语义锁定。实验结果表明,MIND在多个数据集上显著提高了融合质量和下游脑肿瘤分割准确性,展现出在智能临床决策支持系统中的应用潜力。
🔬 方法详解
问题定义:本文旨在解决现有医学图像融合方法在全局应用统一规则时,缺乏对诊断意图和病理结构的深刻理解的问题。这导致了融合效果的不足,无法满足临床需求。
核心思路:MIND的核心思路是利用BioMedGPT生成意图驱动的融合文本,指导融合过程,并通过多尺度潜在适配器提取源图像特征,确保特征的维度对齐,从而提升融合效果。
技术框架:MIND的整体架构包括三个主要模块:意图生成模块(BioMedGPT)、多尺度潜在适配器和医学语义一致性损失模块。意图生成模块负责生成融合文本,多尺度潜在适配器用于提取和对齐源图像特征,而语义一致性损失则确保融合图像与文本之间的深层语义一致性。
关键创新:MIND的关键创新在于引入了意图驱动的融合文本生成和多尺度潜在适配器,这与传统方法的全局统一规则形成了本质区别,能够更好地适应不同的病理结构和诊断需求。
关键设计:在设计中,采用了严格的维度对齐策略来注入源图像特征,并引入医学语义一致性损失,以确保融合图像与文本之间的深层语义锁定。这些设计细节有效提升了融合质量和下游任务的表现。
🖼️ 关键图片
📊 实验亮点
在Harvard、BraTS和GFP数据集上的实验结果显示,MIND显著提高了融合质量,尤其在脑肿瘤分割任务中,分割准确性提升了XX%(具体数据未知),相较于基线方法表现出显著优势,验证了其有效性和实用性。
🎯 应用场景
该研究的潜在应用领域包括医学影像学、临床决策支持系统和智能医疗。通过提升医学图像融合的质量,MIND能够为医生提供更准确的诊断依据,进而改善患者的治疗效果。未来,该技术有望在更广泛的医疗场景中得到应用,推动智能医疗的发展。
📄 摘要(原文)
Medical image fusion aims to integrate complementary information from diverse imaging modalities to support clinical diagnosis. Existing methods typically apply uniform fusion rules globally, lacking a deep understanding of diagnostic intents and pathological structures. To address these limitations, we propose MIND, a Multimodal Intent-Driven Network via Diffusion Transformers (DiTs) for medical image fusion. Specifically, we utilize BioMedGPT to generate intent-driven fusion texts from source images, guiding the fusion process with pathology-aware diagnostic intents. To combat the loss of 2D spatial continuity caused by 1D sequence flattening in DiTs, we design a Multi-scale Latent Adapter. This module explicitly extracts source image features before serialization, injecting them into the network via strict dimensional alignment to effectively supplement image features. To resolve the semantic shift caused by decoupling image outputs from diagnostic intents, we design a medical semantic consistency loss. This loss ensures deep semantic locking between fused images and fusion texts while maintaining the stability of the underlying physical manifold reconstruction. Comprehensive experiments on the Harvard, BraTS, and GFP datasets reveal that MIND delivers superior fusion quality, significantly improves downstream brain tumor segmentation accuracy, and enables flexible interactive fusion, holding significant promise for intent-driven intelligent clinical decision support systems.