Foundation Models Adaptation for Multi-View Multi-modal Cardiac MRI Segmentation and Direct Ejection Fraction Estimation
作者: Sina Amirrajab, Cian M Scannell, Volker Vehof, Michael Bietenbeck, Ali Yilmaz
分类: cs.CV
发布日期: 2026-08-07
💡 一句话要点
提出基础模型适应方法以解决多视角多模态心脏MRI分割问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 心脏MRI 基础模型 多模态分析 分割技术 射血分数估计 深度学习 医学影像
📋 核心要点
- 现有的心脏MRI分析方法在处理异构多视角和多序列数据时效果不佳,导致分割精度不足。
- 本研究通过微调和组合不同的CMR基础模型,提出了一种新的方法来提高多视角CMR分析的效果。
- 实验结果显示,cine分割和LVEF估计的性能显著提升,Dice分数和相关性指标均达到了较高水平。
📝 摘要(中文)
基础模型在心脏MRI(CMR)分析中展现出强大的迁移能力,但其在异构多视角和多序列CMR分析中的有效性尚不明确。本研究探讨了不同CMR基础模型的微调和组合,以应对通用多序列、多中心和多视角CMR分割挑战。通过对CineMA进行微调,实现了短轴和长轴视图下的cine和晚期钆增强(LGE)分割。在直接左心室射血分数(LVEF)估计中,利用两种冻结的CMR基础模型提取嵌入向量,并通过基于注意力的多实例学习进行LVEF回归。在挑战验证集中,cine分割在短轴、双腔和四腔cine MRI中分别达到了0.862、0.883和0.902的Dice分数,而LGE分割在各视图中达到了0.621到0.846的Dice分数。直接LVEF回归模型的平均绝对误差为4.96个百分点,Pearson相关系数为0.91。这些结果表明基础模型可以有效适应和组合用于多视角CMR分析,而准确的LGE瘢痕分割仍然是一个具有挑战性的任务。
🔬 方法详解
问题定义:本论文旨在解决多视角多模态心脏MRI分割和左心室射血分数估计中的有效性问题。现有方法在处理异构数据时表现不佳,导致分割精度和估计准确性不足。
核心思路:论文提出通过微调和组合不同的CMR基础模型,利用注意力机制进行多实例学习,从而提高多视角和多序列数据的分析效果。
技术框架:整体架构包括两个主要模块:首先是对CineMA模型进行微调以实现cine和LGE分割,其次是利用冻结的基础模型提取嵌入向量并进行LVEF回归。
关键创新:本研究的创新在于将不同的基础模型进行组合,并通过注意力机制优化LVEF估计,这在现有文献中尚属首次。
关键设计:在模型微调过程中,采用了特定的损失函数以优化分割精度,并在LVEF回归中使用了多实例学习策略,以提高模型的泛化能力。具体参数设置和网络结构细节在论文中有详细描述。
🖼️ 关键图片
📊 实验亮点
实验结果显示,cine分割在短轴、双腔和四腔cine MRI中的Dice分数分别为0.862、0.883和0.902,LGE分割的Dice分数在0.621到0.846之间。直接LVEF回归模型的平均绝对误差为4.96个百分点,Pearson相关系数达到0.91,表明模型性能显著提升。
🎯 应用场景
该研究的潜在应用领域包括心脏病学中的影像分析、临床诊断支持系统以及个性化医疗方案的制定。通过提高心脏MRI分析的准确性,能够为医生提供更可靠的决策依据,进而改善患者的治疗效果和预后。
📄 摘要(原文)
Foundation models have shown strong transferability in cardiac MRI (CMR), but their effectiveness for heterogeneous multi-view and multi-sequence CMR analysis remains unclear. In this work, we explore the effectiveness of fine-tuning and combining different CMR foundation models for the Universal Multi-Sequence, Multi-Center and Multi-View CMR Segmentation (CMR-Multi) Challenge. CineMA was fine-tuned for cine and late gadolinium enhancement (LGE) segmentation across short-axis and long-axis views. For direct left-ventricular ejection fraction (LVEF) estimation, we used two recent frozen CMR foundation models to extract embedding vectors that were then combined using attention-based multiple-instance learning for LVEF regression. In the challenge validation set, cine segmentation achieved Dice scores of 0.862, 0.883, and 0.902 for short-axis, two-chamber and four-chamber cine MRI, respectively. LGE segmentation achieved Dice scores between 0.621 and 0.846 across views. The direct LVEF regression model achieved an MAE of 4.96 percentage points and a Pearson correlation of 0.91. These results indicate that foundation models can be effectively adapted and combined for multi-view CMR analysis, while accurate LGE scar segmentation remains a challenging task.