A report-grounded vision-language foundation model for colonoscopy from 280000 routine reports
作者: Jia Yu, Yan Zhu, Yili He, Zilong Wang, Xinyang Jiang, Peiyao Fu, Ruijie Yang, Tianyi Chen, Siyuan Li, Zhihua Wang, Fei Wu, Quanlin Li, Xian Yang, Pinghong Zhou, Shuo Wang
分类: cs.AI
发布日期: 2026-07-30
💡 一句话要点
提出EndoCLIP以解决内窥镜报告与图像关联不足问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 内窥镜检查 视觉-语言模型 多模态学习 临床应用 图像-文本匹配
📋 核心要点
- 现有的视觉-语言模型在内窥镜检查中应用不足,导致临床发现与图像之间的关联较弱。
- 本文提出的EndoCLIP模型通过训练大量病变级别的图像-文本对,旨在改善内窥镜报告的图像关联性。
- EndoCLIP在多个任务中表现优异,尤其在良恶性分类中,其性能接近专家水平,显示出显著的提升。
📝 摘要(中文)
尽管内窥镜检查中记录了丰富的专家描述,但现有的视觉-语言模型在此领域的应用仍然不足。现有报告通常总结整个过程,而非逐帧描述,导致临床发现与图像之间的关联较弱。本文开发的EndoCLIP模型,基于280,476份常规内窥镜记录中的125,756个病变级别的图像-文本对进行训练,显著提升了病变级别图像-文本检索、结构化报告生成及多中心临床分类任务的表现。EndoCLIP在良恶性分类任务中,其线性探针的表现接近12名内窥镜专家的盲测结果,表明通过恢复发现与图像帧的对应关系,可以将常规文档转化为可扩展的监督,进而使临床目标能够用语言指定,而无需为每个任务单独标注。
🔬 方法详解
问题定义:本文旨在解决内窥镜检查中视觉-语言模型应用不足的问题,现有方法无法有效关联临床发现与图像,导致信息传递不畅。
核心思路:EndoCLIP模型通过从大量常规内窥镜报告中提取病变级别的图像-文本对,建立起图像与文本之间的强关联,进而提升模型在临床任务中的表现。
技术框架:EndoCLIP的整体架构包括数据预处理、图像-文本对的生成、模型训练及评估等主要模块,采用先进的视觉-语言编码器进行特征提取和融合。
关键创新:EndoCLIP的核心创新在于利用大规模的内窥镜报告数据,恢复发现与图像帧的对应关系,从而实现更高效的监督学习,与传统方法相比,显著提升了模型的适用性和准确性。
关键设计:在模型设计中,采用了特定的损失函数以优化图像-文本对的匹配度,并在网络结构上进行了调整,以适应内窥镜图像的特征提取需求。
🖼️ 关键图片
📊 实验亮点
在实验中,EndoCLIP在病变级别图像-文本检索、结构化报告生成和多中心临床分类任务中均表现优异,尤其在良恶性分类任务中,其线性探针的表现接近12名内窥镜专家的盲测结果,显示出显著的性能提升。
🎯 应用场景
EndoCLIP模型在内窥镜检查领域具有广泛的应用潜力,能够提高临床报告的自动化生成和图像分析的准确性,进而提升医生的工作效率和诊断质量。未来,该模型还可扩展至其他医学影像领域,推动多模态学习的发展。
📄 摘要(原文)
Vision-language models remain underused in colonoscopy despite the rich expert descriptions recorded in routine reports. These reports document lesion appearance, size and location but summarise entire procedures rather than caption individual frames, leaving clinical findings only weakly linked to the corresponding images. Here we develop EndoCLIP, a colonoscopy vision-language foundation model trained on 125,756 lesion-level image-text pairs progressively recovered from 280,476 routine colonoscopy records. Across lesion-level image-text retrieval, structured report generation and six multi-centre clinical classification tasks, EndoCLIP outperforms general-purpose and biomedical vision-language encoders in both zero-shot and linear-probe settings. On benign-versus-malignant classification, its linear probe approaches the performance of expert readers in a blinded study involving 12 endoscopists. These results suggest that recovering finding-to-frame correspondence can transform routine documentation into scalable supervision, enabling clinical targets to be specified in language rather than separately annotated for each task.