Large Language Model Few-Shot Prompting with Dilemma Training Outperforms Human Surrogates in Predicting Patient Preferences
作者: Natasha Ureyang, Sebastian Porsdam Mann, Yuxin Liu, Zuriel Hassirim, Melanie Almonte, Wenhao Chen, Joyce Ng, Thant Nay Lin, Aung Thiha, Gerald CH Koh, Brian David Earp, Pin Sym Foong
分类: cs.HC, cs.LG
发布日期: 2026-08-26
💡 一句话要点
提出P4-DT以解决患者偏好预测的准确性问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 患者偏好预测 困境训练 个性化医疗 决策支持系统 上下文感知AI
📋 核心要点
- 现有方法在预测患者偏好时准确率较低,导致决策冲突,尤其是在复杂医疗情境中。
- 论文提出P4-DT,通过困境训练与用户互动,动态引导个体偏好推理,克服静态评分的局限。
- 实验结果显示,P4-DT的预测准确率达到81.7%,显著高于传统方法和未辅助的代理,提升效果明显。
📝 摘要(中文)
在严重疾病中,人类代理常常难以准确预测患者偏好(准确率为68%),导致决策冲突。个性化患者偏好预测器(P4)代理提供了潜在解决方案,但之前的原型将价值视为静态评分,忽视了医疗选择的情境依赖性。基于“关怀逻辑”,我们提出了P4-DT(困境训练),该代理通过与用户互动多样的医疗困境,利用双向训练引导个体偏好推理。在对12对患者-代理的研究中,P4-DT以81.7%的准确率预测患者治疗选择,显著高于随机预测(OR = 5.61 [2.03, 15.51], p < .001),并超越了未辅助代理(55.0%;OR = 3.67 [1.59, 8.47], p = .002)及P4-DT辅助的代理(61.7%)。比较提示分析显示,结合情境决策和开放式文本的方式使准确率提高了15.0个百分点。我们讨论了进一步测试和设计具备更丰富人类经验的上下文感知AI代理的意义,以便在复杂决策中进行合作。
🔬 方法详解
问题定义:论文要解决的问题是如何提高人类代理在预测患者医疗偏好时的准确性。现有方法往往将患者的价值观视为静态评分,未能考虑医疗选择的情境依赖性,导致准确率低下。
核心思路:论文的核心解决思路是通过P4-DT(困境训练)与用户进行互动,构建动态的患者决策政策。通过多样的医疗困境,激发个体的偏好推理,从而提高预测的准确性。
技术框架:整体架构包括用户交互模块、困境生成模块和偏好推理模块。用户通过面对不同的医疗困境,系统收集其反馈并进行双向训练,以形成个性化的决策政策。
关键创新:最重要的技术创新点在于引入了困境训练的概念,通过情境化的决策过程来动态捕捉患者的偏好,与传统静态评分方法形成本质区别。
关键设计:在设计中,关键参数包括困境的多样性和开放式文本的使用,损失函数则考虑了预测准确性与用户反馈的结合,网络结构采用了双向训练机制,以增强模型的适应性和准确性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,P4-DT在预测患者治疗选择时的准确率达到81.7%,显著高于随机预测的68%(OR = 5.61, p < .001),并且超越了未辅助代理的55%(OR = 3.67, p = .002)和P4-DT辅助的代理61.7%。此外,结合情境决策和开放式文本的方式使准确率提高了15.0个百分点,显示出显著的提升效果。
🎯 应用场景
该研究的潜在应用领域包括医疗决策支持系统、个性化医疗和患者参与决策等。通过提高患者偏好的预测准确性,P4-DT能够帮助医疗专业人员更好地理解患者需求,从而优化治疗方案,提升患者满意度和治疗效果。未来,该技术有望在更广泛的医疗场景中推广应用。
📄 摘要(原文)
In serious illness, human surrogates often struggle to accurately predict patient preferences (68% accuracy), causing decision conflict. Personalized Patient Preference Predictor (P4) agents offer a potential solution, but prior prototypes treat values as static ratings, ignoring the contextual, situation-dependent nature of medical choices. Grounded in the 'logic of care', we present P4-DT (Dilemma Training), a P4 agent that constructs a patient decision policy by engaging users with varied medical dilemmas, eliciting individual preference reasoning through bi-directional training. In a study with 12 patient-surrogate dyads, P4-DT predicted patient treatment choices with 81.7% accuracy, significantly exceeding chance (OR = 5.61 [2.03, 15.51], p < .001) and outperforming both unassisted surrogates (55.0%; OR = 3.67 [1.59, 8.47], p = .002) and surrogates assisted by P4-DT (61.7%). Comparative prompt analyses showed that incorporating contextual scenario decisions and open-ended text improved accuracy by 15.0 percentage points over initial values ratings alone. We discuss implications for further testing and designing of context-aware AI agents that embody richer human experience to partner in complex decision-making.