LLM4CKD: Large Language Models for Early Stage Chronic Kidney Disease Screening

📄 arXiv: 2609.04013v1 📥 PDF

作者: Muhammad Ashad Kabir, Sirajam Munira

分类: cs.AI, cs.LG

发布日期: 2026-09-03

备注: Accepted at ICDM 2026


💡 一句话要点

提出LLM4CKD以解决慢性肾病早期筛查问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 慢性肾病 大型语言模型 零-shot学习 少-shot学习 数据效率 医疗筛查 机器学习 深度学习

📋 核心要点

  1. 现有的机器学习和深度学习方法在慢性肾病筛查中需要大量标注数据,限制了其实际应用。
  2. 本研究提出了一种利用大型语言模型进行CKD筛查的框架,采用临床特征和结构化提示模板,避免了任务特定训练。
  3. 实验结果显示,LLMs在低数据环境下表现出竞争力,常常超越传统方法,但在输入复杂性增加时表现不稳定。

📝 摘要(中文)

慢性肾病(CKD)的早期筛查对于及时干预至关重要,但现有的机器学习(ML)和深度学习(DL)方法通常需要标注数据和模型训练,限制了其在实际筛查中的应用。本研究评估了大型语言模型(LLMs)在零-shot和少-shot上下文学习设置下对CKD筛查的有效性,并与传统的ML和DL方法进行了比较。我们提出了一个框架,利用临床选择的表格特征和结构化提示模板,使LLM能够在不进行特定任务训练的情况下进行推理。结果表明,LLMs在低数据环境下能够实现竞争性表现,通常与传统方法相匹配或超越。然而,随着输入复杂性的增加,其性能依赖于模型且稳定性较差。总体而言,研究结果强调了数据效率与稳定性之间的权衡,表明LLMs在标注数据有限时可作为CKD筛查的灵活补充方法。

🔬 方法详解

问题定义:本论文旨在解决慢性肾病(CKD)早期筛查中对标注数据和模型训练的依赖问题。现有的机器学习和深度学习方法在实际应用中受到限制,尤其是在数据稀缺的情况下。

核心思路:论文提出了一种利用大型语言模型(LLMs)进行CKD筛查的框架,采用零-shot和少-shot学习策略,通过结构化提示和临床特征进行推理,避免了传统方法的训练需求。

技术框架:整体架构包括数据预处理、特征选择、提示模板设计和模型推理四个主要模块。首先,从临床数据中选择相关特征,然后设计结构化提示,最后利用LLMs进行推理和结果评估。

关键创新:本研究的主要创新在于将LLMs应用于CKD筛查,展示了其在低数据环境下的有效性,并与传统的ML和DL方法进行了系统比较,突出了其灵活性和适应性。

关键设计:在提示模板的设计中,采用了多种风格和特征配置,评估了不同设置下LLMs的表现。同时,实验中还对比了标准的ML、DL和表格基础模型(TFM)基线,确保了结果的全面性和可靠性。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果表明,LLMs在少量示例下能够实现与传统机器学习和深度学习方法相当的性能,尤其是在低数据环境中,表现出明显的优势。具体而言,LLMs在某些设置下的准确率与现有CKD筛查工具相当或更优,但在输入复杂性增加时,性能的稳定性有所下降。

🎯 应用场景

该研究的潜在应用领域包括医疗健康,尤其是在慢性肾病的早期筛查中。通过利用大型语言模型,医疗机构可以在缺乏大量标注数据的情况下,快速有效地进行CKD筛查,从而提高患者的早期干预率,降低疾病进展风险。未来,该方法可能扩展到其他疾病的筛查和诊断中,具有广泛的实际价值。

📄 摘要(原文)

Early screening of chronic kidney disease (CKD) is critical for timely intervention, yet most machine learning (ML) and deep learning (DL) approaches require labeled data and model training, limiting their use in real-world screening settings. This study evaluates the effectiveness of large language models (LLMs) for CKD screening under zero-shot and few-shot in-context learning settings and compares them with traditional ML and DL methods. We propose a framework that uses clinically selected tabular features and structured prompt templates to enable LLM-based inference without task-specific training. LLM performance is evaluated across multiple prompt styles, feature configurations, and data settings, and compared with standard ML, DL, and tabular foundation model (TFM) baselines, and existing CKD screening tools. The results show that LLMs can achieve competitive performance using only a small number of examples, often matching or outperforming traditional approaches in low-data settings. However, their performance remains model-dependent and less stable as input complexity increases. In contrast, ML, DL, and TFM models show more consistent improvement with larger training data. Overall, the findings highlight a trade-off between data efficiency and stability, suggesting that LLMs may serve as a flexible complementary approach for CKD screening when labeled data are limited.