CoM$^3$eT: A foundation model for medical image analysis through federated, multidimensional context integration

📄 arXiv: 2608.16268v1 📥 PDF

作者: J. Raphael Schäfer, Kai Geissler, Till Nicke, Chiara Tappermann, Karoline Heber, Eike Petersen, Habib Mergan, Lars Ole Schwen, Nick Weiss, Annika Gerken, Jan Hendrik Moltz, Tom Bisson, Isil Dogan O, Tim-Rasmus Kiehl, Norman Zerbe, Sefer Elezkurtaj, Robin S. Mayer, Nadine Flinner, Peter Wild, Isabel Dahm, Felix Peisen, Heinrich von Busch, Robert Grimm, Sebastian Arndt, Lisa Siegler, Matthias Stefan May, Antje Prasse, Natalia Artysh, Fabian Kiessling, Johannes Lotz

分类: cs.CV, cs.LG

发布日期: 2026-08-17


💡 一句话要点

提出CoM$^3$eT以解决医学图像分析中的多任务学习问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 医学图像分析 多任务学习 联邦学习 变换器模型 稀疏与密集预测 多维数据处理 模型泛化能力

📋 核心要点

  1. 现有医学基础模型通常局限于单一专业领域,无法有效整合多种任务和数据类型。
  2. CoM$^3$eT通过注意力机制建模多维上下文,统一处理不同专业和输出类型的医学图像分析任务。
  3. 在多项公开竞赛中,CoM$^3$eT的表现超越其他模型,且在参数训练上显著降低了资源需求。

📝 摘要(中文)

医学基础模型在有限标注数据下提升AI模型的泛化能力,但通常局限于单一专业领域,如病理学或放射学,并且只能处理稀疏或密集输出。本文提出了CoM$^3$eT(共表示多维多任务医学变换器),该模型统一了病理学与放射学、稀疏与密集预测,以及二维及更高维输入,通过注意力机制建模多维上下文。CoM$^3$eT在涵盖稀疏和密集预测任务及报告生成的五个断层扫描、四个全标本和三个二维数据集的公开竞赛中表现优于其他医学基础模型。该模型在不同临床应用中,训练不到2.5%的参数即可达到与完全微调相当的性能,支持在无高性能GPU集群的情况下进行研究。应用于医院间的联邦学习时,该方法的性能与通过互联网连接的汇总数据训练相当,且可在消费级硬件上实现。

🔬 方法详解

问题定义:现有医学图像分析模型多集中于单一任务或领域,导致模型泛化能力不足,且在处理不同类型数据时效率低下。

核心思路:CoM$^3$eT通过整合多维上下文信息,采用注意力机制来统一处理稀疏与密集预测任务,提升模型的适用性和性能。

技术框架:该模型包括多个模块,首先通过输入层接收不同维度的数据,然后通过多层变换器结构进行特征提取,最后输出稀疏或密集的预测结果。

关键创新:CoM$^3$eT的核心创新在于其多任务学习能力和对多维数据的处理能力,能够在不同专业领域间进行有效迁移,显著提高了模型的泛化能力。

关键设计:模型在训练时仅需调整不到2.5%的参数,采用特定的损失函数来平衡稀疏与密集任务的训练,同时优化了网络结构以适应不同数据类型。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在公开竞赛中,CoM$^3$eT在五个断层扫描、四个全标本和三个二维数据集上表现优异,超越了其他医学基础模型。其在不同临床应用中,训练参数少于2.5%时仍能达到与完全微调相当的性能,显示出显著的资源效率。

🎯 应用场景

CoM$^3$eT在医学图像分析领域具有广泛的应用潜力,能够支持病理学、放射学等多个专业的研究与实践。其高效的训练方式使得在资源有限的环境下也能进行高质量的医学图像分析,推动了临床应用的普及与发展。

📄 摘要(原文)

Medical foundation models improve generalization when training AI models with limited labeled data, but remain confined to a single specialty, such as pathology or radiology, and to either sparse or dense outputs, such as classification or segmentation. Here, we present CoM$^3$eT (Co-representation Multidimensional Multitask Medical Transformer), a medical vision foundation model that unifies pathology and radiology, sparse and dense predictions, and two- and higher-dimensional inputs by modeling multidimensional context with attention. CoM$^3$eT outperformed other medical foundation models in an open competition spanning five tomographic, four whole-specimen, and three two-dimensional datasets, covering sparse and dense prediction tasks as well as report generation. When adapted across diverse clinical applications, training fewer than 2.5% of parameters achieved performance comparable to full fine-tuning, enabling research without access to high-performance GPU clusters. Applied to federated learning across hospitals, this approach achieved performance comparable to pooled-data training over internet connections and with consumer-grade hardware.