CARE: Confidence-Aware Reasoning for Reliable Medical VQA

📄 arXiv: 2608.10964v1 📥 PDF

作者: Yuetian Du, Yucheng Wang, Zhenyuan Chen, Luyuan Chen, Rongyu Zhang, Jinjian Zhang, Wei Zhou, Zhijie Xu, Ming Kong, Zhan Zhou, Jie Liu, Qiang Zhu

分类: cs.CV, cs.AI

发布日期: 2026-08-11

备注: Accepted by MICCAI 2026

🔗 代码/项目: GITHUB


💡 一句话要点

提出CARE框架以解决医疗VQA中的信心误校准问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 医疗视觉问答 信心感知 多模态大语言模型 强化微调 链式思维推理 临床决策支持 模型校准

📋 核心要点

  1. 现有的医疗多模态大语言模型在视觉问答中存在信心误校准的问题,导致表达的信心与实际诊断准确性不符,影响临床应用。
  2. CARE框架通过双阶段管道,首先生成结构化数据进行微调,然后利用信心感知奖励机制优化模型的信心与诊断正确性之间的关系。
  3. 在三个医疗VQA基准测试中,CARE框架不仅提高了诊断准确性,还显著降低了期望校准误差和幻觉率,展示了其有效性。

📝 摘要(中文)

强化微调(RFT)使医疗多模态大语言模型(MLLMs)能够进行链式思维(CoT)推理,但这些模型存在信心误校准的问题,即表达的确定性与实际诊断准确性之间的系统性差距,影响临床信任。我们提出了CARE,一个信心感知的医疗推理框架,通过双阶段管道联合优化准确性和校准性。首先,采用可扩展的医疗CoT合成为监督微调提供结构化的冷启动数据。其次,采用具有新颖信心感知奖励机制的群体相对策略优化(GRPO),将模型的信心与诊断正确性联系在奖励信号中。在三个医疗VQA基准上,CARE实现了最高的诊断准确性,同时获得最低的期望校准误差和幻觉率,为可信的临床决策支持奠定了基础。

🔬 方法详解

问题定义:本论文旨在解决医疗视觉问答(VQA)中存在的信心误校准问题,现有方法在表达信心与实际诊断准确性之间存在系统性差距,影响了临床信任和决策支持。

核心思路:提出CARE框架,通过双阶段管道优化模型的准确性和信心校准,首先生成结构化的冷启动数据,然后通过信心感知奖励机制提升模型的信心与诊断正确性之间的关联性。

技术框架:CARE框架包括两个主要阶段:第一阶段是医疗CoT合成,提供结构化数据用于监督微调;第二阶段是群体相对策略优化(GRPO),结合信心感知奖励机制进行模型训练。

关键创新:CARE的主要创新在于引入信心感知奖励机制,将模型的信心与诊断正确性直接关联,解决了传统方法中信心与准确性不一致的问题。

关键设计:在技术细节上,CARE采用了特定的损失函数来平衡准确性和校准性,并设计了适应性调整的奖励机制,以确保模型在训练过程中能够有效学习到信心与准确性的关系。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在三个医疗VQA基准测试中,CARE框架实现了最高的诊断准确性,具体表现为最低的期望校准误差和幻觉率,显著优于现有基线模型,展示了其在临床决策支持中的有效性和可靠性。

🎯 应用场景

CARE框架的潜在应用领域包括医疗影像分析、临床决策支持系统和智能医疗助手等。通过提高模型的信心校准性,该研究能够增强医疗AI系统的可靠性,促进其在实际临床环境中的应用和推广。

📄 摘要(原文)

Reinforcement Fine-Tuning (RFT) has enabled medical Multimodal Large Language Models (MLLMs) to produce Chain-of-Thought (CoT) reasoning for visual question answering, yet these models suffer from $\textit{confidence miscalibration}$---a systematic gap between expressed certainty and actual diagnostic accuracy that undermines clinical trust. We propose $\textbf{CARE}$, a $\textbf{C}$onfidence-$\textbf{A}$ware medical $\textbf{RE}$asoning framework that jointly optimizes accuracy and calibration through a dual-stage pipeline. First, a scalable Medical-CoT synthesis provides structured cold-start data for Supervised Fine-Tuning. Second, Group Relative Policy Optimization (GRPO) with a novel $\textbf{Confidence-Aware Reward (CAR)}$ mechanism ties the model's confidence to diagnostic correctness within the reward signal. Across three Medical VQA benchmarks, $\textbf{CARE}$ achieves the highest diagnostic accuracy while obtaining the lowest Expected Calibration Error and Hallucination Rate, establishing a foundation for trustworthy clinical decision support. Our code is available at https://github.com/anotherbricki/CARE.