Future Querying: Can LLMs Serve as Implicit Medical World Models?

📄 arXiv: 2608.23248v1 📥 PDF

作者: Siri Willems, James Butterworth, Lore Goetschalckx, Peter Vrancx, Philippe Modard, Elke Giets, Ludovic Denoyer

分类: cs.CL, cs.AI

发布日期: 2026-08-24

备注: This paper is accepted at The 1st MICCAI Workshop on Medical World Models (MICCAI-2026)


💡 一句话要点

提出未来查询以解决传统临床预测模型的局限性

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大型语言模型 隐式医学世界模型 临床预测 非结构化文本 未来查询 数据隐私 医疗决策支持

📋 核心要点

  1. 核心问题:现有的临床预测模型依赖于结构化数据,扩展性差且未能有效利用非结构化文本。
  2. 方法要点:提出未来查询,通过大型语言模型评估其在临床查询中的应用,避免手动特征工程。
  3. 实验或效果:在合成医学报告数据集和真实ICU笔记上评估,结果显示LLMs能够捕捉临床动态的某些方面。

📝 摘要(中文)

传统的临床预测模型依赖于特定任务的管道和经过整理的结构化数据,这种方法扩展性差且未能充分利用非结构化文本。为了解决这一问题,本文提出了未来查询的概念,探讨大型语言模型(LLMs)是否可以作为隐式医学世界模型,通过评估其回答关于患者未来的时间索引临床查询的能力。我们的框架在非结构化临床文档上运行,采用与端点无关的训练,使单一模型能够回答多样的临床查询,而无需手动特征工程或特定任务的再训练。实验结果表明,小型本地微调的开放权重模型可以匹配或接近更大规模的专有系统,适合隐私保护的本地部署。

🔬 方法详解

问题定义:本文旨在解决传统临床预测模型在处理非结构化文本时的局限性,现有方法往往依赖于特定任务的结构化数据,导致扩展性不足和信息利用不充分。

核心思路:提出未来查询的概念,探讨大型语言模型(LLMs)作为隐式医学世界模型的潜力,通过评估其回答时间索引临床查询的能力,旨在实现对患者未来情况的预测。

技术框架:整体架构包括数据预处理、模型训练和查询响应三个主要模块。数据预处理阶段将非结构化临床文档转化为可用于训练的格式,模型训练阶段采用与端点无关的训练方法,最后在查询响应阶段,模型能够根据患者轨迹回答多样的临床查询。

关键创新:最重要的技术创新在于使用大型语言模型作为隐式医学世界模型,避免了传统方法中繁琐的特征工程和任务特定的再训练,提升了模型的灵活性和适应性。

关键设计:在模型训练中,采用了小型本地微调的开放权重模型,设置了适当的损失函数以优化模型在临床查询上的表现,确保模型能够在隐私保护的环境中有效运行。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

实验结果表明,经过本地微调的小型开放权重模型在合成医学报告数据集和真实ICU笔记上的表现与大型专有系统相当,展示了LLMs在捕捉临床动态方面的潜力。这一发现为隐私保护的本地部署提供了有力支持。

🎯 应用场景

该研究的潜在应用领域包括临床决策支持系统、患者监测和个性化医疗。通过利用大型语言模型,医疗机构可以在不依赖于复杂的结构化数据的情况下,快速响应临床查询,从而提高医疗服务的效率和质量。未来,该方法可能会在医疗数据分析和智能诊断中发挥重要作用。

📄 摘要(原文)

Traditional clinical prediction models rely on task-specific pipelines and curated, structured data, which scale poorly and underutilize unstructured text. To address this, we introduce future querying, a paradigm that probes whether large language models (LLMs) can function as implicit medical world models by evaluating their ability to answer time-indexed clinical queries about a patient's future. Our framework operates on unstructured clinical documentation using endpoint-agnostic training, enabling a single model to answer diverse clinical queries over patient trajectories without manual feature engineering or task-specific retraining. We show that small, locally fine-tuned open-weight models can match or approach larger proprietary systems, making the framework suitable for privacy-preserving, on-premise deployment. Evaluated on a new synthetic medical reports dataset and real ICU notes from the MIMIC-IV dataset, our results provide encouraging evidence that LLMs can capture aspects of clinical dynamics.