Implicit Neural Representations for Multimodal Longitudinal Image Imputation and Interpolation

📄 arXiv: 2608.02324v1 📥 PDF

作者: Sina Wendrich, Lukas Förner, Zoe Reinke, Kartikay Tehlan, Ansgar Berlis, Michael Frühwald, Matthias Wagner, Thomas Wendler

分类: cs.CV

发布日期: 2026-08-03


💡 一句话要点

提出条件隐式神经表示以解决多模态MRI图像插补问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 隐式神经表示 多模态MRI 图像插补 深度学习 医学成像 肿瘤学 数据缺失处理

📋 核心要点

  1. 现有的多模态MRI成像方法在处理缺失数据和异构采集协议时面临挑战,导致重建质量下降。
  2. 本文提出了一种条件隐式神经表示(INR),通过建模世界坐标、时间和模态条件来实现多模态MRI的插补与插值。
  3. 实验结果表明,该方法在T1CE和FLAIR图像上相较于线性插值有显著提升,且置信度与重建质量高度相关。

📝 摘要(中文)

纵向多参数MRI在肿瘤学的随访成像中至关重要,但现实临床数据常常存在缺失序列、异构采集协议和时间点间空间分辨率变化等问题。本文提出了一种患者特定的条件隐式神经表示(INR),将多模态纵向MRI建模为世界坐标、时间和模态条件的连续函数。该模型通过随机模态丢弃进行训练,以处理不完整数据,其连续坐标空间的形式使得在不重采样到固定体素网格的情况下实现空间和时间插值。我们在儿科脑肿瘤患者的纵向MRI上评估了该框架,显示出在T1CE和FLAIR上相较于线性插值具有统计显著性改进(p < 0.05),T1CE的平均MS-SSIM为0.95 ± 0.02。预测的置信度与真实重建质量强相关(Pearson r高达0.996),表明在异构临床环境中的可靠部署潜力。

🔬 方法详解

问题定义:本文旨在解决纵向多模态MRI成像中由于缺失序列和异构采集协议导致的图像重建问题。现有方法往往依赖于固定体素网格,无法有效处理不完整数据,影响重建质量。

核心思路:提出的条件隐式神经表示(INR)通过将MRI数据建模为世界坐标、时间和模态的连续函数,能够灵活处理缺失数据并实现空间和时间的插值。

技术框架:该框架包括数据预处理、模型训练和推理三个主要阶段。模型通过随机模态丢弃进行训练,推理时利用自一致性置信度估计器评估重建质量。

关键创新:最重要的创新在于提出了条件隐式神经表示,允许在不重采样的情况下进行空间和时间插值,显著提升了重建质量。

关键设计:模型采用了随机模态丢弃策略以增强对不完整数据的鲁棒性,损失函数设计考虑了多模态重建的自一致性,网络结构则基于深度学习框架进行优化。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,提出的方法在T1CE和FLAIR图像上相较于线性插值具有统计显著性改进(p < 0.05),T1CE的平均MS-SSIM达到0.95 ± 0.02。同时,预测的置信度与真实重建质量的Pearson相关系数高达0.996,表明模型的可靠性。

🎯 应用场景

该研究具有广泛的应用潜力,尤其是在肿瘤学的随访成像中,可以帮助医生更准确地评估病情变化。此外,模型的灵活性和鲁棒性使其在其他医学成像领域也具备应用价值,未来可能推动个性化医疗的发展。

📄 摘要(原文)

Longitudinal multiparametric MRI is central to follow-up imaging in oncology, yet real-world clinical data are characterised by missing sequences, heterogeneous acquisition protocols, and varying spatial resolutions across time points. We propose a patient-specific conditional implicit neural representation (INR) that models multimodal longitudinal MRI as a continuous function of world coordinates, time, and modality conditioning. The model is trained with stochastic modality dropout to handle incomplete data, and its continuous coordinate-space formulation enables both spatial and temporal interpolation without resampling to a fixed voxel grid. A self-consistency-based confidence estimator is derived from cross-modal reconstruction performance at inference time. We evaluate the framework on longitudinal MRI from paediatric brain tumour patients, demonstrating statistically significant improvements over linear interpolation for T1CE and FLAIR (p < 0.05), with mean MS-SSIM of 0.95 $\pm$ 0.02 for T1CE. Predicted confidence correlates strongly with true reconstruction quality (Pearson r up to 0.996), suggesting reliable deployment potential in heterogeneous clinical settings.