DS@GT ARC at ImageCLEFmedical 2026: Architectural Diversity for Concept Detection and Foundation-Model Scaling for Caption Prediction in Medical Image Analysis
作者: Bowen Wang, Youwen Zhang, Ritesh Mehta
分类: cs.CV, cs.IR, cs.LG
发布日期: 2026-07-30
备注: 21 pages, 9 figures
🔗 代码/项目: GITHUB
💡 一句话要点
提出多样化架构以解决医学图像分析中的概念检测与标题生成问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 医学图像分析 概念检测 标题生成 深度学习 模型集成 KNN检索 稀有概念 阈值调优
📋 核心要点
- 现有医学图像分析方法在概念检测和标题生成方面存在验证过拟合和模型规模不一的挑战。
- 论文提出了一种三路后期融合的集成模型和无训练KNN检索管道,以提高概念检测的准确性和效率。
- 实验结果显示,主要F1得分达到0.5790,次要F1得分为0.9657,展示了显著的性能提升。
📝 摘要(中文)
我们描述了DS@GT在ImageCLEFmedical Caption 2026挑战中的提交,该挑战继续在ROCOv2数据集上进行,包含两个任务:概念检测(任务1)和标题生成(任务2)。在任务1中,我们的主要提交是一个三路后期融合的集成模型,结合了ConvNeXt-V2、BiomedCLIP ViT-B/16和DenseNet-169,并采用了正则化的“诚实阈值调优”程序,以避免在稀有概念上的验证过拟合。该提交在官方评估中排名第一,主要F1得分为0.5790,次要F1得分为0.9657。同时,我们还提交了一个基于冻结BiomedCLIP嵌入的无训练KNN检索管道,主要F1得分为0.5780,几乎与精调集成模型相匹配。任务2中,我们的提交包括精调的Gemma-3 27B模型(整体得分0.3571,官方排名第三)、完全精调的BLIP管道和零样本MedGemma-4B运行,涵盖了广泛的模型规模和训练成本。
🔬 方法详解
问题定义:本论文旨在解决医学图像分析中的概念检测和标题生成问题,现有方法在处理稀有概念时容易出现验证过拟合,且模型规模和训练成本差异较大。
核心思路:我们提出了一种三路后期融合的集成模型,结合多种先进架构,并引入“诚实阈值调优”程序,以提高模型在稀有概念上的鲁棒性。同时,采用无训练的KNN检索方法,降低了计算成本。
技术框架:整体架构包括两个主要任务:任务1为概念检测,使用ConvNeXt-V2、BiomedCLIP ViT-B/16和DenseNet-169进行融合;任务2为标题生成,使用Gemma-3和BLIP等模型进行精调和零样本推理。
关键创新:最重要的创新在于引入了“诚实阈值调优”程序,显著降低了稀有概念的验证过拟合风险,同时通过无训练KNN方法实现了高效的概念检测。
关键设计:在模型设计中,采用了多种深度学习架构的集成,设置了适当的超参数,并使用了特定的损失函数以优化模型性能。
🖼️ 关键图片
📊 实验亮点
实验结果显示,主要F1得分为0.5790,次要F1得分为0.9657,均在官方评估中排名第一。同时,基于BiomedCLIP的KNN检索管道以0.5780的主要F1得分几乎匹配精调集成模型,展现了显著的成本效益。
🎯 应用场景
该研究在医学图像分析领域具有广泛的应用潜力,能够帮助医生更准确地进行图像解读和诊断。通过提高概念检测和标题生成的效率,能够加速医学研究和临床实践中的信息获取与处理,未来可能推动智能医疗的发展。
📄 摘要(原文)
We describe the DS@GT submissions to the ImageCLEFmedical Caption 2026 challenge, which continues a long-running benchmark on the ROCOv2 dataset with two tracks: Concept Detection (Task 1), assigning UMLS Concept Unique Identifiers (CUIs) to radiology images, and Caption Prediction (Task 2), generating natural-language captions. For Task 1, our primary submission was a three-way late-fusion ensemble of ConvNeXt-V2, BiomedCLIP ViT-B/16, and DenseNet-169 with a regularized ''Honest Threshold Tuning'' procedure designed to avoid validation overfitting on rare concepts; this submission ranked first on the official submission with a primary $F_1$ of $0.5790$ and a secondary $F_1$ of $0.9657$. In parallel, we submitted a training-free KNN retrieval pipeline over frozen BiomedCLIP embeddings, which reached a primary $F_1$ of $0.5780$ and a secondary $F_1$ of $0.9599$-essentially matching the fine-tuned ensemble on the primary track at a fraction of the cost. For Task 2, our submissions included a fine-tuned Gemma-3 27B model (overall $0.3571$, ranking third in the official submission), a fully fine-tuned BLIP pipeline with custom Vizwins merging ($0.3564$), and a zero-shot MedGemma-4B run with a PubMed-style prompt ($0.3186$), spanning a wide range of model scales and training costs. Code: https://github.com/dsgt-arc/imageclef-caption-2026.