Few-Shot Concept Prompt Learning for Segmentation Foundation Models via Visual Grounding

📄 arXiv: 2608.01663v1 📥 PDF

作者: Rahul Venkataramani, Rachana Sathish

分类: cs.CV, cs.AI

发布日期: 2026-08-03


💡 一句话要点

提出少样本概念提示学习以解决医学图像分割问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 医学图像分割 少样本学习 视觉提示 掩膜监督 自然语言处理

📋 核心要点

  1. 现有的医学图像分割模型在临床任务中的表现未能达到预期,主要原因是缺乏有效的图像-文本配对监督。
  2. 论文提出了少样本概念提示学习(FS-CPL),通过掩膜监督从小型支持集学习视觉基础的提示嵌入,解决了现有方法的结构性限制。
  3. 在四个公共基准测试中,FS-CPL相较于传统文本提示实现了最高达0.62的Dice绝对提升,且对主干网络无依赖性。

📝 摘要(中文)

可提示的分割基础模型(FMs)如SAM和Medical SAM在医学成像中通过自然语言接口实现少样本交互式分割,但在临床任务中的表现远未达到预期。我们认为这种不足并非由于医学预训练不足或提示措辞不当,而是结构性限制,尤其在配对图像-文本监督稀缺的领域。我们假设,采用视觉基础的提示,直接从目标分布学习,可以在不增加图像-文本数据或重训练主干网络的情况下恢复性能。我们提出了少样本概念提示学习(FS-CPL),通过掩膜监督从小型支持集学习连续概念提示嵌入,且编码器-解码器主干保持冻结。在四个公共基准测试中,FS-CPL相较于传统文本提示实现了最高达0.62的Dice绝对提升,并且对主干网络无依赖性,提升了SAM和领域特定预训练的Medical SAM的性能,表明视觉概念提示对领域内预训练是互补的。

🔬 方法详解

问题定义:本论文旨在解决医学图像分割模型在临床任务中表现不佳的问题,现有方法受限于稀缺的图像-文本配对监督,导致性能不足。

核心思路:提出的FS-CPL方法通过学习视觉基础的提示嵌入,直接从小型支持集中的图像-掩膜对中获取信息,从而克服了传统自然语言提示的局限性。

技术框架:FS-CPL的整体架构包括一个冻结的编码器-解码器主干网络,利用掩膜监督从支持集学习连续的概念提示嵌入,进而用于分割任务。

关键创新:FS-CPL的主要创新在于引入视觉基础的提示学习,避免了对额外图像-文本数据或主干网络重训练的需求,展现了与传统方法的本质区别。

关键设计:在设计上,FS-CPL采用了特定的损失函数以优化掩膜监督效果,同时确保了主干网络的冻结状态,以保持模型的稳定性和有效性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

FS-CPL在四个公共基准测试中表现优异,相较于传统文本提示,Dice系数提升最高达0.62,且对不同主干网络均有效,显示出其广泛的适用性和强大的性能提升潜力。

🎯 应用场景

该研究的潜在应用领域包括医学成像、临床诊断和手术辅助等,能够为医生提供更高效的图像分割工具,提升临床决策的准确性和效率。未来,该方法可能扩展到其他需要少样本学习的领域,具有广泛的实际价值。

📄 摘要(原文)

Promptable segmentation foundation models (FMs) such as SAM3 and Medical SAM3 promise few-shot, interactively-specified segmentation for medical imaging through a natural language interface, yet their performance on clinical tasks falls well short of this promise. We posit that this shortfall is not an artefact of insufficient medical pretraining or imperfect prompt phrasing, but a structural limitation that will persist in any domain where paired image-text supervision is scarce, as it is across most clinical modalities. We further hypothesize that the limitation is specific to natural language as a control signal: a visually grounded prompt, learned directly from the target distribution, should recover the lost performance without additional image-text data or backbone retraining. We propose Few-Shot Concept Prompt Learning (FS-CPL), which learns a continuous concept prompt embedding $\mathbf{p}^* \in \mathbb{R}^{T \times d}$ from a small support set of $K$ image--mask pairs via mask supervision, with the encoder-decoder backbone frozen. Across four public benchmarks spanning ultrasound and endoscopy (BUSI, HC18, TN3K, CVC-Clinic), FS-CPL delivers absolute Dice improvements of up to $+0.62$ over canonical text prompts and is \emph{backbone-agnostic}: it lifts both vanilla SAM3 and the domain-specifically pretrained Medical SAM3, showing that visual concept prompting is complementary to in-domain pretraining.