Benchmarking Foundation and Large Language Models for Few-Shot Medical Image Segmentation
作者: Jinghong Liu, Yuchuan Deng, Fanping Liu, Meng Huang, Xirong Li
分类: cs.CV
发布日期: 2026-07-30
💡 一句话要点
提出FAME基准以评估少样本医学图像分割方法
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 少样本分割 医学图像 基准评估 视觉适应 目标缺失识别 语义转移 成像模式 ROI分类
📋 核心要点
- 现有的少样本医学图像分割方法在评估设置上存在不一致性,导致其相对有效性不明确。
- 论文提出了FAME基准,旨在统一评估不同的FS-MIS解决方案,并提供丰富的测试样本和评估指标。
- 实验结果表明,直接视觉适应优于基于提示的策略,且增加支持样本的效果依赖于模型的利用能力。
📝 摘要(中文)
少样本医学图像分割(FS-MIS)旨在从少量标注支持样本中分割出新的感兴趣区域(ROI)。尽管已有快速进展,但现有FS-MIS解决方案在不同的评估设置下进行评估,导致其相对有效性不明确。我们引入FAME,一个统一的基准,用于评估FS-MIS解决方案,涵盖专家、基于SAM的方法、基于CLIP的方法和基于MLLM的方法。FAME包含14,958个测试样本,跨越7个解剖部位、9种成像模式和14个ROI类别,并在零样本和十样本设置下评估模型,同时额外评估目标缺失识别和在协变量及语义变化下的泛化能力。我们的评估揭示了几个发现,首先,有效的少样本分割依赖于模型如何利用支持样本:直接的视觉适应通常优于基于提示的策略。其次,增加支持样本仅在模型能够有效利用时才会提高性能。最后,语义转移仍然比成像领域适应更具挑战性,强定位能力并不一定意味着可靠的目标缺失识别。我们希望FAME能提供对当前FS-MIS解决方案的全面理解,并促进更有效和可靠的少样本医学分割方法的发展。
🔬 方法详解
问题定义:本论文旨在解决少样本医学图像分割(FS-MIS)方法在评估时存在的不一致性问题。现有方法在不同的设置下进行评估,导致其相对有效性难以比较。
核心思路:论文提出FAME基准,旨在为FS-MIS解决方案提供统一的评估标准,涵盖多种方法并提供丰富的测试样本,以便更好地理解和比较不同方法的性能。
技术框架:FAME基准包含14,958个测试样本,覆盖7个解剖部位、9种成像模式和14个ROI类别。评估模型时采用零样本和十样本设置,并额外评估目标缺失识别和在协变量及语义变化下的泛化能力。
关键创新:FAME基准的提出是本研究的核心创新点,它为FS-MIS领域提供了一个全面的评估框架,能够系统性地比较不同方法的有效性。与现有方法相比,FAME在评估设置和样本多样性上具有显著优势。
关键设计:在实验中,模型的评估不仅关注分割性能,还考虑了如何有效利用支持样本的能力。实验结果显示,直接视觉适应策略在性能上优于基于提示的策略,且支持样本的增加效果依赖于模型的利用能力。
🖼️ 关键图片
📊 实验亮点
实验结果表明,直接视觉适应策略在性能上优于基于提示的策略,且在有效利用支持样本的情况下,增加支持样本数量能够显著提升分割性能。具体而言,FAME基准下的模型在零样本和十样本设置下的表现均有显著提升,提供了对现有方法性能的深入洞察。
🎯 应用场景
该研究的潜在应用领域包括医学影像分析、临床诊断辅助和自动化医疗系统。通过提供一个统一的评估基准,FAME能够帮助研究人员和开发者更好地理解现有方法的优缺点,从而推动更有效的少样本医学分割技术的发展,最终提升医疗服务的质量和效率。
📄 摘要(原文)
Few-shot medical image segmentation (FS-MIS) aims to segment novel regions of interest (ROIs) from a few annotated support examples. Despite rapid progress, existing FS-MIS solutions span diverse paradigms but are evaluated under inconsistent settings, leaving their relative effectiveness unclear. We introduce FAME, a unified benchmark for evaluating FS-MIS solutions, covering specialists, SAM-based methods, CLIP-based methods, and MLLM-based methods. FAME contains 14,958 test samples across 7 anatomical sites, 9 imaging modalities, and 14 ROI categories, and evaluates models under zero-shot and ten-shot settings with additional assessment of target-absence recognition and generalization under covariate and semantic shifts. Our evaluation reveals several findings. First, effective few-shot segmentation depends on how models exploit support examples: direct visual adaptation generally outperforms prompt-based strategies. Second, increasing support examples improves performance only when models can effectively utilize them. Third, semantic transfer remains substantially more challenging than imaging-domain adaptation, and strong localization ability does not necessarily imply reliable target-absence recognition. We hope FAME provides a comprehensive understanding of current FS-MIS solutions and facilitates the development of more effective and reliable few-shot medical segmentation methods.