GPAgentBench-2K: Benchmarking Large Language Model Agents in Complex Clinical Action Space

📄 arXiv: 2608.30188v1 📥 PDF

作者: Boqi Chen, Xudong Liu, Yunke Ao, Heejin Do, Jianing Qiu

分类: cs.CL

发布日期: 2026-08-31


💡 一句话要点

提出GPAgentBench-2K以解决临床决策中的行动空间限制问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大型语言模型 临床决策 约束马尔可夫决策过程 安全性 强化学习 医疗人工智能

📋 核心要点

  1. 现有的基准测试将临床工作流程简化为静态预测,无法有效评估LLMs在复杂临床决策中的表现。
  2. 论文提出GPAgentBench-2K,构建了一个基于真实GP接触记录的约束马尔可夫决策过程基准,涵盖多种临床行动。
  3. 实验结果显示,随着行动空间的扩大,LLMs的性能显著下降,且高风险案例中安全约束的违反率高达50%以上。

📝 摘要(中文)

大型语言模型(LLMs)在临床代理中展现出巨大潜力,但现有基准将临床工作流程简化为静态预测或不受约束的马尔可夫决策过程(MDPs),且动作集合粗糙。为此,我们提出了GPAgentBench-2K,这是首个针对初级医疗临床决策的约束马尔可夫决策过程(CMDP)LLM代理基准,基于真实GP接触的专家验证记录构建。我们的环境模型涵盖六种基础临床行动,施加了行动空间的拓扑工作流先验,并将安全知情的弃权作为一项重要结果。对16种最先进的LLMs的评估显示,随着行动空间的扩大,性能显著下降。重要的是,我们发现了临床质量与安全之间的差距:即使是具有最高诊断准确率的前沿模型,在超过一半的高风险案例中也违反了安全约束。最后,我们使用约束组相对策略优化(C-GRPO)建立了参考点,表明显式建模约束在性能上优于不受约束的强化学习方法,但仍远未达到临床可接受的安全标准。

🔬 方法详解

问题定义:现有方法在评估大型语言模型在临床决策中的应用时,往往忽视了复杂的行动空间和安全约束,导致模型在实际应用中表现不佳。

核心思路:论文通过引入GPAgentBench-2K,构建了一个约束马尔可夫决策过程基准,旨在更真实地模拟临床决策过程,并将安全知情的弃权纳入考量。

技术框架:该框架包括六种基础临床行动的模型,施加拓扑工作流先验,并通过专家验证的真实数据进行训练和评估。

关键创新:最重要的创新在于引入了约束马尔可夫决策过程的概念,使得模型在决策时不仅考虑准确性,还考虑安全性,从而填补了临床质量与安全之间的差距。

关键设计:在模型设计中,采用了约束组相对策略优化(C-GRPO)作为基准,设置了多种安全约束,并在训练过程中优化了损失函数以平衡准确性与安全性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,随着行动空间的扩大,16种最先进的LLMs的性能显著下降,尤其是在高风险案例中,超过50%的案例违反了安全约束。这一发现突显了临床质量与安全之间的显著差距,强调了在临床决策中考虑安全性的必要性。

🎯 应用场景

该研究的潜在应用领域包括初级医疗、临床决策支持系统和智能医疗助手等。通过提供更安全和有效的决策支持,GPAgentBench-2K有望提升临床工作流程的效率和安全性,减少医疗错误,最终改善患者的健康结果。未来,该基准可能推动更多关于LLMs在医疗领域应用的研究与开发。

📄 摘要(原文)

Large Language Models (LLMs) show great potential as clinical agents, yet existing benchmarks reduce clinical workflows to static predictions or unconstrained Markov Decision Processes (MDPs) with coarse action sets. To address this, we introduce GPAgentBench-2K, the first Constrained MDP (CMDP) LLM-agent benchmark for primary-care clinical decision-making, constructed from expert-validated records of real-world GP encounters. Our environment models a full spectrum of six foundational clinical actions, imposes a topological workflow prior over the action space, and operationalizes safety-informed abstention as a first-class outcome. Evaluating 16 state-of-the-art LLMs reveals a significant performance degradation as the action space scales. Crucially, we uncover a clinical quality-safety gap: even frontier models with the highest diagnosis accuracy violate safety constraints in over half of high-risk cases. Finally, we establish a reference point using Constrained Group Relative Policy Optimization (C-GRPO), and show that while explicitly modeling constraints improves performance over unconstrained RL methods, it remains far from clinically acceptable safety.