Anatomy Contextualized Adaption of CT Foundation Models

📄 arXiv: 2607.27154v1 📥 PDF

作者: Roshan Kenia, Stephanie L McNamara, William Lotter

分类: cs.CV, cs.AI

发布日期: 2026-07-29

备注: Accepted to the European Conference on Computer Vision (ECCV) 2026 MedFM-Bench Workshop


💡 一句话要点

提出解剖上下文适应框架以提升CT基础模型的解剖对齐能力

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: CT影像分析 视觉-语言对齐 解剖上下文 轻量模型 跨解剖关系 医学影像处理 深度学习

📋 核心要点

  1. 现有CT视觉-语言基础模型通常使用整体体积表示,导致细粒度解剖信号的稀释,影响模型性能。
  2. 本文提出解剖上下文适应(ACA)框架,通过适应冻结的CT基础模型实现解剖级视觉-语言对齐,同时增强全局上下文。
  3. 在Merlin和CT-RATE数据集上的实验表明,ACA在零-shot查找分类任务中优于现有方法,且训练时间显著减少。

📝 摘要(中文)

CT视觉-语言基础模型在下游任务中表现出色,但通常使用整体体积表示,导致细粒度解剖信号的稀释。细粒度视觉-语言预训练通过对齐解剖级视觉特征与特定文本来解决此问题,但会丢失整体上下文。现有细粒度方法从头训练,计算成本高。本文提出解剖上下文适应(ACA),该轻量框架在增强全局上下文的同时,适应冻结的CT基础模型表示以实现解剖级视觉-语言对齐。ACA利用TotalSegmentator将CT体积分解为解剖级嵌入,通过捕捉跨解剖关系的变换器进行精炼,并与从放射学报告中提取的每个解剖和扫描级文本对齐。在Merlin和CT-RATE上的评估显示,ACA在零-shot查找分类中始终优于冻结基础模型基线和现有细粒度方法,且在嵌入缓存后训练时间少于一小时。ACA的跨解剖变换器学习的注意力权重还表明了合理的跨解剖上下文路由。这些结果支持ACA作为一种轻量的方法,以实现CT基础模型的解剖基础视觉-语言对齐,同时保留和增强全局解剖上下文。

🔬 方法详解

问题定义:本文旨在解决现有CT视觉-语言基础模型在细粒度解剖信号与整体上下文之间的权衡问题。现有细粒度方法通常从头训练,计算成本高,且无法有效利用全局上下文信息。

核心思路:ACA框架通过适应冻结的CT基础模型,利用解剖级嵌入与文本对齐,同时引入跨解剖关系的捕捉机制,从而实现解剖级视觉-语言对齐并增强全局上下文。

技术框架:ACA的整体架构包括三个主要模块:首先,使用TotalSegmentator将CT体积分解为解剖级嵌入;其次,通过变换器精炼这些嵌入以捕捉跨解剖关系;最后,将嵌入与从放射学报告中提取的文本进行对齐。

关键创新:ACA的主要创新在于其轻量级设计,能够在不重新训练整个模型的情况下,快速适应CT基础模型以实现解剖级对齐,同时保留全局上下文信息。这与现有方法的从头训练方式形成鲜明对比。

关键设计:ACA采用了特定的损失函数以优化解剖级嵌入与文本的对齐,变换器的结构设计使其能够有效捕捉跨解剖关系,此外,注意力机制的设计使得模型能够合理地进行跨解剖上下文路由。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在Merlin和CT-RATE数据集上的实验结果显示,ACA在零-shot查找分类任务中 consistently 优于冻结基础模型基线和现有细粒度方法,训练时间少于一小时,显著提高了模型的性能和效率。

🎯 应用场景

该研究的潜在应用领域包括医学影像分析、放射学报告生成和辅助诊断系统。ACA框架的轻量化特性使其适合于临床环境中快速部署,能够提升CT图像的解读效率和准确性,具有重要的实际价值和未来影响。

📄 摘要(原文)

CT vision-language foundation models have demonstrated promising performance across downstream tasks, but are typically trained with whole-volume representations that dilute fine-grained anatomical signals. Fine-grained vision-language pre-training addresses this by aligning anatomy-level visual features with anatomy-specific text, but in doing so discards the global context that whole-volume models provide. Furthermore, existing fine-grained approaches train from scratch, making them computationally expensive. We introduce Anatomy Contextualized Adaptation (ACA), a lightweight framework that adapts frozen CT foundation model representations for anatomy-level vision-language alignment while enhancing global contextualization. ACA uses TotalSegmentator to decompose CT volumes into anatomy-level embeddings, which are refined via a transformer that captures cross-anatomy relationships, and aligned to both per-anatomy and scan-level text extracted from radiology reports. Evaluated on Merlin and CT-RATE, ACA consistently outperforms both the frozen foundation model baselines and existing fine-grained methods in zero-shot finding classification, while requiring less than one hour of training once embeddings are cached. The attention weights learned by ACA's inter-anatomy transformer additionally indicate plausible cross-anatomy context routing. Altogether, these results support ACA as a lightweight approach for adapting CT foundation models to anatomically grounded vision-language alignment while preserving and enhancing global anatomical context.