Evaluating Multi-Turn Multimodal Diagnostic Reasoning on Challenging Real-World Clinical Cases
作者: Rui Yang, Weihao Xuan, Yi Lin, Zhuhan Bao, Jonathan Chong Kai Liew, Matthew Yu Heng Wong, Nicolás Lescano, Nikita R. Paripati, Emily Ling-Lin Pai, Jiarui Liu, Heli Qi, Heng-Jui Chang, Benny Kai Guo Loo, Huitao Li, Kunyu Yu, Yufan Wang, Chuan Hong, Shijian Lu, Douglas Teodoro, Naoto Yokoya, Ross Koppel, Mona Diab, Hua Xu, David W. Bates, Nan Liu, Yifan Peng
分类: cs.CL, cs.AI
发布日期: 2026-07-28
💡 一句话要点
提出ClinMM-Bench以解决多轮多模态临床诊断评估问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态诊断 临床评估 大语言模型 诊断推理 错误分析 医学图像 数据集构建
📋 核心要点
- 现有多模态大语言模型评估方法多依赖单轮任务,无法全面反映真实临床诊断的复杂性。
- 本文提出ClinMM-Bench基准,包含大量真实案例与医学图像,系统评估多轮多模态诊断能力。
- 实验结果显示,尽管专有模型的诊断准确率较高,但在生成可靠推理方面仍存在显著不足。
📝 摘要(中文)
临床诊断评估不仅要评估模型的正确性,还需反映临床实践的复杂性,包括多模态信息的逐步披露、诊断假设的动态更新和临床推理的持续完善。现有的多模态大语言模型(MLLMs)评估通常依赖于单轮或孤立任务,难以全面捕捉真实临床诊断的复杂性。为此,本文开发了ClinMM-Bench,这是迄今为止最大的多轮多模态临床诊断评估基准,包含1,089个真实临床案例和3,760张医学图像。通过两级评估框架对15个代表性MLLMs进行系统评估,结果显示专有模型的整体诊断准确率最高,但完全正确的诊断比例在所有模型中仍然有限。当前模型在生成可靠的诊断推理方面存在显著局限,错误分析进一步识别出五种典型的失败模式。
🔬 方法详解
问题定义:本文旨在解决现有多模态大语言模型在临床诊断评估中的不足,尤其是无法反映多轮交互和信息更新的复杂性。现有方法往往依赖于单一任务,无法全面捕捉真实临床场景中的动态变化。
核心思路:论文提出ClinMM-Bench基准,通过包含多轮交互和多模态信息,系统评估模型的诊断准确性和推理质量。该设计旨在更真实地模拟临床诊断过程,提升模型在实际应用中的有效性。
技术框架:ClinMM-Bench包含1,089个临床案例和3,760张医学图像,覆盖八个专业领域。评估采用两级框架,分别评估诊断准确性和推理质量。
关键创新:最重要的创新点在于构建了一个大规模的多轮多模态评估基准,能够全面评估模型在真实临床环境中的表现,填补了现有评估方法的空白。
关键设计:在评估过程中,采用了多种评估指标,包括诊断准确率和推理质量,设计了针对性强的错误分析,识别出信息综合失败、知识映射错误等五种典型失败模式。
🖼️ 关键图片
📊 实验亮点
实验结果表明,专有模型在整体诊断准确率上表现最佳,但完全正确的诊断比例仍然有限,显示出当前模型在生成可靠推理方面的不足。错误分析揭示了五种主要失败模式,为未来模型的改进提供了重要参考。
🎯 应用场景
该研究的潜在应用领域包括临床决策支持系统、医疗图像分析和智能诊断助手等。通过提升多模态模型的诊断能力,ClinMM-Bench可为医疗行业提供更为精准的辅助决策工具,未来可能显著改善临床诊断效率和准确性。
📄 摘要(原文)
Clinical diagnostic evaluation should not only assess whether models can provide correct diagnoses, but also reflect the realities of clinical practice, including progressive disclosure of multimodal information, dynamic updating of diagnostic hypotheses, and continuous refinement of clinical reasoning. However, existing evaluations of multimodal large language models (MLLMs) typically rely on single-turn or isolated tasks, making it difficult to fully capture the complexity of real-world clinical diagnosis. To bridge this gap, we developed ClinMM-Bench, the largest multi-turn multimodal clinical diagnostic evaluation benchmark to date. ClinMM-Bench contains 1,089 challenging real-world clinical cases and 3,760 medical images across eight specialties. We systematically evaluated 15 representative MLLMs using a two-level evaluation framework that assessed both diagnostic accuracy and diagnostic reasoning quality. Results showed that proprietary models achieved the highest overall diagnostic accuracy, but the proportion of completely correct diagnoses remained limited across all models. In terms of diagnostic reasoning quality, current models can identify plausible diagnostic directions but still have considerable limitations in generating reliable diagnostic reasoning. Error analysis further identified five representative failure modes: information synthesis failure, knowledge mapping error, perception error, premature closure, and visual hallucination.