Benchmarking Clinical Decision Pathway Adherence in Large Language Models
作者: Nuo Chen, Xinyang Jiang, Zilong Wang, Zhifei Zhang, Xiaoye Qu, Jiajun Deng, Yulan Guo, Cairong Zhao
分类: cs.CL
发布日期: 2026-08-27
💡 一句话要点
提出MEGA-CDP以评估医疗大语言模型的临床决策路径遵循性
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 临床决策路径 大语言模型 医疗AI 评估基准 指南遵循性 智能医疗 决策支持系统
📋 核心要点
- 现有的医疗大语言模型评估主要集中在最终答案的准确性,缺乏对模型遵循临床实践指南能力的全面评估。
- 本文提出MEGA-CDP基准,通过构建临床案例与指南的映射,评估医疗LLM生成遵循指南的决策路径能力。
- 实验结果显示,当前的医疗LLM在提供可靠的临床决策支持方面仍存在显著挑战,强调了CDP导向评估的重要性。
📝 摘要(中文)
遵循临床实践指南定义的临床决策路径(CDPs)对于安全可靠的医疗决策至关重要。然而,现有的医疗大语言模型(LLM)基准主要评估最终答案的准确性,无法充分评估模型遵循指南的能力。为了解决这一问题,本文提出了MEGA-CDP基准,用于评估医疗LLM在生成遵循指南的CDPs方面的能力。MEGA-CDP基于2274个中英文临床实践指南构建,通过指南到案例的流程,生成了42353个具有明确参考CDPs的临床案例。该基准支持单轮情境和多轮互动设置,并引入了CDP导向的评估框架来测量路径一致性。对16个代表性LLM的实验表明,当前模型在提供可靠的临床决策支持方面仍面临挑战,强调了CDP导向评估的必要性及MEGA-CDP在推动医疗LLM遵循指南方面的价值。
🔬 方法详解
问题定义:本文旨在解决医疗大语言模型在生成遵循临床实践指南的决策路径方面的评估不足。现有方法主要关注最终答案的准确性,无法有效评估模型的决策过程和路径一致性。
核心思路:提出MEGA-CDP基准,通过将临床实践指南与具体临床案例相结合,评估模型在生成决策路径时的遵循程度。这种设计使得评估不仅限于答案的正确性,还关注决策过程的合规性。
技术框架:MEGA-CDP基准由2274个中英文临床实践指南构建,形成42353个临床案例。评估流程包括单轮情境和多轮互动设置,采用CDP导向的评估框架来测量路径一致性。
关键创新:MEGA-CDP的最大创新在于引入了CDP导向的评估框架,强调模型在决策路径生成中的合规性,而不仅仅是最终结果的准确性。这一方法与传统的评估方式本质上有所不同。
关键设计:在构建MEGA-CDP时,采用了指南到案例的映射流程,确保生成的临床案例具有明确的参考CDPs。此外,评估过程中引入了路径一致性指标,以量化模型的决策过程。
🖼️ 关键图片
📊 实验亮点
实验结果表明,16个代表性医疗大语言模型在遵循临床决策路径方面的表现仍然不尽如人意,显示出当前模型在提供可靠临床决策支持方面的挑战。MEGA-CDP的引入为未来模型的改进提供了重要的评估基准。
🎯 应用场景
该研究的潜在应用领域包括医疗决策支持系统、智能诊断工具以及临床培训平台。通过提升医疗大语言模型对临床实践指南的遵循能力,能够提高医疗决策的安全性和可靠性,最终改善患者的治疗效果。未来,MEGA-CDP有望成为医疗AI系统评估的重要标准。
📄 摘要(原文)
Following clinical decision pathways (CDPs) defined by clinical practice guidelines is essential for safe and reliable medical decision-making. However, existing medical large language model (LLM) benchmarks mainly evaluate final-answer accuracy, providing limited evaluation of models' ability to adhere to guidelines. To address this gap, we introduce MEGA-CDP, a benchmark for evaluating whether medical LLMs can generate guideline-adherent CDPs using provided guidelines as references. MEGA-CDP is constructed from 2,274 English and Chinese clinical practice guidelines through a guideline-to-case pipeline, yielding 42,353 clinical cases with explicit reference CDPs. It supports both single-turn vignette and multi-turn interactive settings, and introduces a CDP-oriented evaluation framework for measuring pathway consistency. Experiments on 16 representative LLMs show that reliable clinical decision support remains challenging for current models, demonstrating the need for CDP-oriented evaluation and the value of MEGA-CDP for advancing guideline adherence in medical LLMs.