MR-JEPA: A General Purpose Video Foundation Model for Cardiac MRI

📄 arXiv: 2608.30975v1 📥 PDF

作者: Athira J. Jacob, Puneet Sharma, Dorin Comaniciu, Daniel Rueckert

分类: cs.CV, cs.AI

发布日期: 2026-08-31

备注: Accepted at STACOM 2026 (MICCAI 2026 peer-reviewed workshop)


💡 一句话要点

提出MR-JEPA以解决心脏MRI视频数据处理问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱八:物理动画 (Physics-based Animation) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 心脏MRI 自监督学习 时空建模 多序列数据 深度学习 医学影像 模型预训练

📋 核心要点

  1. 现有的CMR视频模型通常仅限于处理电影数据,无法充分利用丰富的时序和空间信息。
  2. MR-JEPA通过自监督学习和多序列数据预训练,能够处理3D时空输入,提升了模型的上下文理解能力。
  3. 实验结果显示,MR-JEPA在多个回归任务上均超越了其他对比方法,尤其在心脏功能评估和疾病检测中表现优异。

📝 摘要(中文)

心脏磁共振成像(CMR)生成丰富的时序数据,如时间序列影像和空间LGE/映射堆栈,但大多数深度学习方法仅处理单个2D切片,忽略了上下文信息。本文提出MR-JEPA,一个自监督视频基础模型,扩展LeJEPA至3D时空输入,通过管道令牌化、时空掩蔽增强和从2D CMR基础模型初始化。MR-JEPA在来自10505名患者的多序列数据上进行预训练,涵盖了电影、LGE和映射数据,且无需标注。我们在六个下游任务上评估了冻结的编码器,结果显示MR-JEPA在所有回归任务上均优于其他方法,尤其在LV射血分数和心肌应变任务上表现突出,展示了其在临床心脏定量和诊断中的潜力。

🔬 方法详解

问题定义:本文旨在解决现有CMR视频模型在处理时序和空间信息时的不足,尤其是仅依赖于2D切片的局限性。

核心思路:MR-JEPA通过自监督学习和多序列数据的预训练,利用3D时空输入来增强模型对心脏MRI数据的理解和分析能力。

技术框架:该模型采用了管道令牌化和时空掩蔽增强技术,整体架构包括数据预处理、模型训练和下游任务评估三个主要阶段。

关键创新:MR-JEPA的核心创新在于其能够处理多种CMR序列数据,并且在完全自监督的情况下实现了与领域特定模型的竞争性能。

关键设计:模型的设计包括特定的损失函数和网络结构,采用统一的多视图门控注意力架构,以提高对不同心脏功能指标的预测精度。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

MR-JEPA在LV射血分数和心肌应变任务上表现优异,LV EF MAE为4.79%(r=0.764),GLS MAE为1.87(r=0.805),在应变任务上相较于基线减少了21-27%的MAE。此外,在疾病检测任务中,MR-JEPA的宏观AUG达到了0.868,显示出其强大的自监督学习能力。

🎯 应用场景

MR-JEPA在心脏MRI数据分析中具有广泛的应用潜力,能够为临床心脏定量和疾病诊断提供更为准确和全面的支持。未来,该模型可扩展至其他医学影像领域,推动多模态数据的融合与分析。

📄 摘要(原文)

Cardiac magnetic resonance imaging (CMR) produces rich sequential data such as temporal cine videos and spatial LGE/mapping stacks, yet most deep learning approaches process individual 2D slices, discarding this context. We present MR-JEPA, a self-supervised video foundation model for CMR that extends LeJEPA to 3D spatiotemporal inputs through tubelet tokenization, spatiotemporal masking augmentation, and initialization from a 2D CMR foundation model. Unlike prior CMR video models limited to cine data, MR-JEPA is pretrained on multi-sequence data (cine, LGE, mapping) from 10,505 patients across two centers without annotations. We evaluate the frozen encoder on six downstream tasks using a unified multi-view gated attention architecture: LV ejection fraction, RV ejection fraction, three myocardial strains (GLS, GCS, GRS), and four-class disease detection. MR-JEPA outperforms other compared methods on all five regression tasks, including both a domain-specific CMR model pretrained on more data with text supervision and a natural-video foundation model, achieving an LV EF MAE of 4.79% (r =0.764) and a GLS MAE of 1.87 (r=0.805), with 21-27% MAE reductions over baselines on strain tasks. For disease detection, MR-JEPA achieved a macro AUG of 0.868, remaining competitive with the domain-specific baseline despite using a fully self-supervised pretraining objective. These results demonstrate the potential of a unified video encoder for robust, multi-view utilization of diverse CMR sequences in clinical cardiac quantification and diagnosis.