Explainable Diabetic Retinopathy Classification Using Vision Foundation Models
作者: Abhishek Verma, Anila Krishna, Abhishek Gajanan Bankar, Juan Miguel Lopez Alcaraz
分类: cs.CV, cs.LG
发布日期: 2026-08-28
备注: 11 pages, 4 figures, source code under https://github.com/UOLMDA26/retinopathy_vision_foundational
💡 一句话要点
提出可解释的糖尿病视网膜病变分类框架以提高筛查准确性
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 糖尿病视网膜病变 可解释性 视觉基础模型 迁移学习 深度学习 医疗影像分析 模型评估
📋 核心要点
- 糖尿病视网膜病变的自动筛查方法在准确性和可信度上仍存在不足,亟需改进。
- 本研究提出了一种基于视觉基础模型的可解释分类框架,结合多种迁移学习策略以提升分类性能。
- 实验结果显示,DINOv2-LoRA在内部评估中AUROC达到0.758,外部评估中DINOv2和ViT的AUROC最高可达0.920,表现出显著的提升。
📝 摘要(中文)
糖尿病视网膜病变(DR)是导致可预防失明的重要原因,因此需要准确且可信的自动筛查方法。本研究探讨了一种基于视觉基础模型的可解释DR分类框架,采用多种迁移学习策略。评估了DINOv2、CLIP和视觉变换器(ViT)三种骨干网络,使用全量调优、线性探测和低秩适应(LoRA)进行训练。DINOv2-LoRA在内部评估中获得了最高的AUROC为0.758,而DINOv2全量调优和ViT全量调优在外部评估中获得了最高的AUROC为0.920。通过等距回归后的可靠性分析进一步评估了模型的校准性。为了解释性,使用Grad-CAM和HiResCAM对比专家标注的病变掩膜,结果表明基础模型,特别是DINOv2,能够提供强大的预测性能,而LoRA则为全量调优提供了一种参数高效的替代方案。
🔬 方法详解
问题定义:本研究旨在解决糖尿病视网膜病变(DR)的自动分类问题,现有方法在准确性和可解释性方面存在不足,导致临床应用受限。
核心思路:通过引入视觉基础模型和多种迁移学习策略,构建一个可解释的DR分类框架,以提高模型的预测性能和临床可用性。
技术框架:整体架构包括三个主要阶段:模型选择(DINOv2、CLIP、ViT)、训练策略(全量调优、线性探测、LoRA)和可解释性评估(Grad-CAM、HiResCAM)。
关键创新:本研究的创新点在于结合了LoRA技术,提供了一种参数高效的替代方案,与传统的全量调优方法相比,显著降低了计算成本,同时保持了模型性能。
关键设计:在训练过程中,采用了不同的损失函数和参数设置,特别是在LoRA的实现中,通过低秩适应来优化模型参数,确保在有限的计算资源下实现最佳性能。
🖼️ 关键图片
📊 实验亮点
实验结果显示,DINOv2-LoRA在内部评估中获得了AUROC 0.758,而DINOv2和ViT的全量调优在外部评估中达到了AUROC 0.920,表现出显著的性能提升。此外,Grad-CAM和HiResCAM的可解释性评估结果也表明模型关注的区域与临床相关的病变相符。
🎯 应用场景
该研究的潜在应用领域包括医疗影像分析、糖尿病视网膜病变的早期筛查和诊断。通过提高自动化筛查的准确性和可解释性,能够帮助医生更好地理解模型决策,从而提升临床决策的效率和准确性,最终改善患者的治疗效果。
📄 摘要(原文)
Diabetic retinopathy (DR) is a major cause of preventable blindness, creating a need for accurate and trustworthy automated screening. This study investigates an explainable DR classification framework using vision foundation models and multiple transfer learning strategies. Three backbones, DINOv2, CLIP, and Vision Transformer (ViT), were evaluated using full fine-tuning, linear probing, and Low-Rank Adaptation (LoRA). Models were trained and internally evaluated on the ODIR dataset and externally evaluated on APTOS to assess generalization. DINOv2-LoRA achieved the highest internal AUROC of 0.758, while DINOv2 full fine-tuning and ViT full fine-tuning achieved the highest external AUROC of 0.920. Calibration was further assessed using reliability analysis after isotonic regression. For explainability, Grad-CAM and HiResCAM were evaluated against expert-annotated lesion masks from the IDRiD dataset using Dice, Intersection over Union (IoU), and Pointing Game metrics. The results demonstrate that foundation models, particularly DINOv2, can provide strong predictive performance, while LoRA offers a parameter-efficient alternative to full fine-tuning. Quantitative evaluation of explanation maps further supports the assessment of whether model attention corresponds to clinically relevant retinal lesions.