Unlocking the Power of Medical Tabular Data via Semantic-Aware Multimodal Pre-training

📄 arXiv: 2608.10522v1 📥 PDF

作者: Yingsheng Liu, Haiming Li, Jingmin Zhu, Jiajun Sun, Victoria Mar, Monika Janda, H. Peter Soyer, Zongyuan Ge, Zhen Yu

分类: cs.CV, cs.AI

发布日期: 2026-08-11

备注: INTERNATIONAL CONFERENCE ON MEDICAL IMAGE COMPUTING AND COMPUTER ASSISTED INTERVENTION (ORAL presentation)


💡 一句话要点

提出语义感知多模态预训练框架以提升医学表格数据的利用效率

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 医学数据分析 多模态学习 表格数据处理 深度学习 临床决策支持

📋 核心要点

  1. 现有多模态预训练方法未能充分利用结构化临床表格中的定量诊断信息,导致信息损失。
  2. 提出语义感知框架,通过重要性感知自适应掩蔽和软标签离散化模块,优化表格数据的处理方式。
  3. 在大规模皮肤病学和眼科学数据集上进行实验,取得了新的最先进结果,展示了显著的鲁棒性和泛化能力。

📝 摘要(中文)

尽管视觉-语言模型在医学表示学习中占据主导地位,但非结构化文本缺乏结构化临床表格中固有的密集定量诊断表型。现有的多模态预训练方法由于语义无关的设计,未能充分利用这一潜力。为此,本文提出了一种新颖的语义感知框架,明确建模表格数据的内在二维结构。我们引入了重要性感知自适应掩蔽,构建无标签的课程,优先考虑显著特征。同时,提出了软标签离散化模块,用稳定的分布匹配替代不稳定的数值回归,从而在数学上保持序关系。通过在大规模皮肤病学和眼科学数据集上的广泛实验,建立了新的最先进水平,展示了卓越的鲁棒性和跨领域的泛化能力。

🔬 方法详解

问题定义:本文旨在解决现有多模态预训练方法对医学表格数据的低效利用问题,尤其是对表格数据的平面向量处理和不稳定的回归目标造成的信息损失。

核心思路:通过引入语义感知的设计,明确建模表格数据的二维结构,采用重要性感知自适应掩蔽和软标签离散化模块,优化特征选择和数值处理的稳定性。

技术框架:整体架构包括两个主要模块:首先是重要性感知自适应掩蔽模块,构建无标签的课程以优先处理显著特征;其次是软标签离散化模块,替代传统的数值回归,采用稳定的分布匹配来保持序关系。

关键创新:最重要的技术创新在于引入了重要性感知自适应掩蔽和软标签离散化模块,这些设计使得模型能够更有效地处理表格数据的结构特性,显著提升了模型的表现。

关键设计:在参数设置上,采用了动态调整的掩蔽策略以适应不同特征的重要性;损失函数设计上,使用了分布匹配损失以替代传统的回归损失,确保了模型在处理离散与连续特征时的稳定性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在大规模皮肤病学(SLICE-3D, HOP)和眼科学(EyePACS)数据集上进行的实验表明,所提出的方法建立了新的最先进水平,展示了显著的鲁棒性和跨领域的泛化能力,具体性能提升幅度未知。

🎯 应用场景

该研究的潜在应用领域包括医疗数据分析、临床决策支持系统和智能诊断工具。通过提升医学表格数据的利用效率,能够为医生提供更准确的诊断支持,进而改善患者的治疗效果。未来,该框架有望在其他医疗领域和数据类型中推广应用,推动医学人工智能的发展。

📄 摘要(原文)

While vision-language models dominate medical representation learning, unstructured text lacks the dense, quantitative diagnostic phenotypes inherent in structured clinical tables. However, existing multimodal pre-training methods underutilize this potential due to semantic-agnostic designs that treat tabular inputs as flat vectors and employ unstable continuous regression objectives. To overcome this, we propose a novel semantic-aware framework explicitly modeling the intrinsic two-dimensional structure of tabular data. First, addressing the inter-feature hierarchy of varying diagnostic importance, we introduce Importance-Aware Adaptive Masking to construct a label-free curriculum prioritizing salient features. Second, addressing the intra-feature continuity-discreteness duality, we propose a Soft-Label Discretized Module that replaces unstable numerical regression with stable distribution matching, thereby mathematically preserving ordinal relationships. Extensive experiments across large-scale dermatology (SLICE-3D, HOP) and ophthalmology (EyePACS) datasets establish a new state-of-the-art (SOTA), demonstrating exceptional robustness and cross-domain generalizability.