Unsupervised Adaptation of 3D CT Foundation Models for 3D CBCT Segmentation

📄 arXiv: 2608.27190v1 📥 PDF

作者: Gauthier Miralles, Loic Le Folgoc, Vincent Jugnon, Pietro Gori

分类: cs.CV

发布日期: 2026-08-27

备注: Accepted at the EMA4MICCAI workshop at MICCAI 2026. 11 pages, 4 figures, 1 table. Code, trained models, weights, and liver annotations are available at https://github.com/mirabll/FARR3D/


💡 一句话要点

提出无监督领域适应框架以解决3D CBCT分割问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 无监督领域适应 三维分割 锥形束CT 特征对齐 医学图像处理 深度学习 跨模态学习

📋 核心要点

  1. 现有方法在CBCT分割中面临标注数据稀缺和领域差异带来的挑战,限制了模型的有效迁移。
  2. 本文提出了一种无监督领域适应框架,通过冗余减少特征对齐实现CBCT分割,无需目标领域标注。
  3. 实验结果显示,该方法在肝脏分割任务中显著优于现有的预训练模型和UDA策略,提升了模型的泛化能力。

📝 摘要(中文)

准确的锥形束CT(CBCT)三维分割对于介入和放射治疗至关重要,但受到标注数据稀缺和诊断CT与CBCT之间显著领域差异的限制。本文提出了一种基于冗余减少特征对齐的无监督领域适应(UDA)框架,能够在没有目标领域标注或推理时适应的情况下,实现3D CBCT分割。该框架对架构无关,能够无缝适应基于CNN和ViT的基础模型。我们在两个具有挑战性的CT-CBCT肝脏分割基准上评估了该方法,结果表明,即使是大规模预训练的分割网络,也需要明确的特征空间桥接才能在不同采集模式间进行泛化,而我们的方法在性能上始终优于现有的预训练基础模型和UDA策略。为支持可重复性和基准测试,我们发布了公共CBCT数据集的肝脏分割结果、代码、训练模型和权重。

🔬 方法详解

问题定义:本文旨在解决CBCT三维分割中的标注数据稀缺和诊断CT与CBCT之间的领域差异问题。现有方法在跨模态迁移时效果不佳,限制了其在实际应用中的有效性。

核心思路:提出的无监督领域适应框架通过冗余减少特征对齐来实现CBCT分割,避免了对目标领域标注的依赖,提升了模型的适应性和泛化能力。

技术框架:该框架包括特征提取、特征对齐和分割模块。特征提取模块负责从输入数据中提取特征,特征对齐模块通过对齐源领域和目标领域的特征空间来减少领域间的差异,最后分割模块进行最终的分割预测。

关键创新:本研究的创新点在于提出了一种无监督的特征对齐方法,能够有效地桥接不同采集模式下的特征空间,从而提高了模型的跨模态泛化能力。与传统的有监督方法相比,本文方法不依赖于目标领域的标注数据。

关键设计:在技术细节上,采用了特定的损失函数来优化特征对齐过程,并设计了适用于CNN和ViT的网络结构,以确保框架的架构无关性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,提出的方法在两个CT-CBCT肝脏分割基准上均优于现有的预训练模型和UDA策略,具体提升幅度达到XX%(具体数据未知),验证了特征空间对齐的重要性和有效性。

🎯 应用场景

该研究的潜在应用领域包括介入放射学和放射治疗,能够在缺乏标注数据的情况下实现高效的CBCT图像分割,提升临床决策支持的准确性和效率。未来,该方法有望推广到其他医学成像领域,促进跨模态学习的发展。

📄 摘要(原文)

Accurate 3D segmentation of cone-beam CT (CBCT) is critical for interventional and radiation therapy applications, yet it remains limited by two compounding challenges: the scarcity of annotated CBCT data and the large domain shift from diagnostic CT. Interventional CBCT exhibits fundamental modality differences from conventional CT, driven by acquisition and physics effects as well as contrast-specific vascular content, thereby limiting effective cross-modality model transfer. We propose a novel unsupervised domain adaptation (UDA) framework based on redundancy-reducing feature alignment, enabling 3D CBCT segmentation with no target-domain annotations or inference-time adaptation. Our framework is architecture-agnostic, seamlessly adapting both CNN-based and ViT-based foundation models. We evaluate our method on two challenging CT-CBCT liver segmentation benchmarks: one for interventional vascular procedures and one for radiation therapy, demonstrating that even large-scale pretrained segmentation networks require explicit feature-space bridging to generalize across acquisition modalities, and that our approach consistently outperforms existing pretrained foundation model and UDA strategies. To support reproducibility and benchmarking, we release the liver segmentations for a public CBCT dataset, along with the code, trained models, and weights.