CIGTSurv: Clinical Information Guided Tri-modal Survival Prediction with Local Prototype Association and Global Feature Alignment

📄 arXiv: 2608.03247v1 📥 PDF

作者: Jing Dai, Qibin Zhang, Weiwei Zhou, Mingde Xu, Jingsong Liu, Jingdong Zhang, Hongming Xu

分类: cs.CV, cs.CL

发布日期: 2026-08-04

备注: Accepted at MICCAI 2026

🔗 代码/项目: GITHUB


💡 一句话要点

提出CIGTSurv以解决临床信息在生存预测中的低利用问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 生存预测 多模态学习 临床信息 交叉注意力 最大均值差异 癌症研究 数据融合

📋 核心要点

  1. 现有方法在生存预测中未能充分利用临床信息,导致预测准确性不足。
  2. CIGTSurv通过设计文本模板和双层交互机制,整合临床信息与其他模态数据,提升生存预测效果。
  3. 在五个TCGA癌症队列的实验中,CIGTSurv表现出最先进的生存预测性能,超越了现有基线。

📝 摘要(中文)

多模态学习通过整合病理图像与基因组数据显著推动了生存预测的发展。然而,临床信息由于其离散、稀疏和低维特性,尽管在反映患者整体健康方面至关重要,却仍未得到充分利用。此外,这些模态之间的固有异质性在建模跨模态交互时也带来了显著挑战。本文提出了CIGTSurv,一个临床信息引导的三模态生存预测框架。我们首先设计了一个整体文本模板,并使用预训练的基础模型将临床表格数据转化为高维的标记嵌入。以临床信息为锚点,我们引入了双层交互机制:1) 基于交叉注意力的局部原型关联模块(LPA),显式学习不同模态之间的标记级对应关系;2) 基于最大均值差异(MMD)的全局特征对齐损失(GFA),隐式增强跨模态分布一致性。在五个TCGA癌症队列上的广泛实验表明,CIGTSurv实现了最先进的生存预测性能。

🔬 方法详解

问题定义:本文旨在解决临床信息在生存预测中低利用的问题。现有方法主要依赖于病理图像和基因组数据,忽视了临床信息的潜在价值,导致预测效果受限。

核心思路:CIGTSurv的核心思路是通过引入临床信息作为锚点,设计双层交互机制来增强不同模态之间的关联性,从而提升生存预测的准确性。

技术框架:CIGTSurv框架包括两个主要模块:局部原型关联(LPA)模块和全局特征对齐(GFA)损失。LPA模块通过交叉注意力机制学习不同模态的标记级对应关系,而GFA损失则通过最大均值差异(MMD)来增强模态间的分布一致性。

关键创新:CIGTSurv的关键创新在于引入了临床信息作为交互的基础,并通过双层机制显著提升了跨模态学习的效果。这一设计与传统方法相比,能够更好地捕捉模态间的复杂关系。

关键设计:在模型设计中,使用了预训练的基础模型来处理临床表格数据,并通过交叉注意力机制实现局部原型关联。此外,GFA损失函数的设计确保了模态间的分布一致性,从而提升了整体预测性能。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在五个TCGA癌症队列的实验中,CIGTSurv实现了最先进的生存预测性能,超越了现有的基线模型,显示出显著的提升幅度。具体而言,CIGTSurv在生存预测准确性上提高了X%(具体数据未知),证明了其在多模态学习中的有效性。

🎯 应用场景

CIGTSurv的研究成果在临床医学领域具有广泛的应用潜力,尤其是在癌症生存预测和个性化医疗方面。通过更好地整合临床信息与其他数据模态,该框架能够为医生提供更准确的患者预后评估,进而优化治疗方案,提高患者的生存率和生活质量。未来,该方法还可以扩展到其他疾病的预测和管理中。

📄 摘要(原文)

Multimodal learning has significantly advanced survival prediction by integrating pathology images with genomic data. However, clinical information, despite its critical role in reflecting a patient' s overall health, remains underutilized due to its discrete, sparse, and low-dimensional nature. Furthermore, the inherent heterogeneity across these modalities pose significant challenges in modeling cross-modal interactions. In this paper, we propose CIGTSurv, a Clinical Information Guided Tri-modal framework for Survival prediction. Specifically, we first design a holistic text template and use pretrained foundation models to transform clinical tabular data into high-dimensional tokenized embeddings. Using clinical information as an anchor, we then introduce a dual-level interaction mechanism: 1) a local prototype association (LPA) module based on cross-attention to explicitly learn token-level correspondences between different modalities, and 2) a global feature alignment (GFA) loss based on Maximum Mean Discrepancy (MMD) to implicitly enhance cross-modal distribution consistency. Extensive experiments on five TCGA cancer cohorts demonstrate that CIGTSurv achieves state-of-the-art (SOTA) survival prediction performance. Our source code is publicly available at https://github.com/Daijing-ai/CIGT-Surv.git.