Surgical Alignment in Knowledge Graph Training for Clinical Diagnosis with Large Language Models
作者: Saksham Khatwani, He Cheng, Majid Afshar, Dmitriy Dligach, Yanjun Gao
分类: cs.CL
发布日期: 2026-08-27
🔗 代码/项目: GITHUB
💡 一句话要点
提出KG信号整合方法以提升临床诊断中的LLM推理能力
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 知识图谱 大型语言模型 临床诊断 推理能力 梯度干预 优化几何 生物医学
📋 核心要点
- 现有方法在将生物医学知识图谱信号整合进大型语言模型时面临知识转移行为不一致的问题。
- 本文提出了一种新的训练方法,通过引入梯度干预密度和梯度失真来分析优化器对预训练模型的影响。
- 实验结果表明,稀疏更新的训练范式在推理质量上优于任务特定的微调,即使其准确性较低。
📝 摘要(中文)
生物医学知识图谱(KGs)提供了结构化的医学知识,可以为大型语言模型(LLMs)在临床诊断应用中的推理提供基础。然而,如何将KG信号有效整合进LLMs仍然是一个未解的问题。本文系统研究了五种KG任务形式、三种训练范式、两种KG和三种基础LLM。在任务层面,所有范式均优于未微调的基线,但在领域内准确性相当的情况下,知识转移行为却显著不同。我们引入了梯度干预密度(GID)和梯度失真(GD)来衡量优化器如何修改预训练模型。GID和GD共同揭示了KG判断训练在KL正则化下产生稀疏、局部更新的特征,而任务特定的SFT则产生密集更新。控制消融实验表明,目标和KL独立贡献于稀疏性,而产生稀疏更新的范式也提高了推理质量,即使其领域内准确性低于任务特定的SFT。因此,评估KG-LLM整合需要将准确性与优化几何诊断相结合。
🔬 方法详解
问题定义:本文旨在解决如何有效整合生物医学知识图谱信号进大型语言模型的问题。现有方法在知识转移行为上存在显著差异,影响了模型的推理能力。
核心思路:论文提出通过引入梯度干预密度(GID)和梯度失真(GD)来评估优化器对预训练模型的影响,从而实现对KG信号的有效整合。
技术框架:整体架构包括KG任务的多种形式、不同的训练范式以及基础LLM的组合。通过对比实验,分析不同方法在知识转移和推理质量上的表现。
关键创新:最重要的技术创新在于提出了“外科对齐”这一概念,强调在KL正则化下的稀疏更新与任务特定微调的密集更新之间的区别。
关键设计:在实验中,采用了KL正则化作为损失函数,设计了不同的训练范式以产生稀疏或密集的梯度更新,从而影响模型的推理质量。
🖼️ 关键图片
📊 实验亮点
实验结果显示,采用KG判断训练的模型在推理质量上显著优于传统的任务特定微调方法,尽管其领域内准确性较低。具体而言,稀疏更新的模型在推理任务中表现出更高的逻辑一致性和推理能力,验证了KG信号整合的重要性。
🎯 应用场景
该研究的潜在应用领域包括临床诊断支持系统和医疗决策辅助工具。通过有效整合知识图谱信号,能够提升大型语言模型在医学领域的推理能力,从而为医生提供更准确的诊断建议,最终改善患者的治疗效果。
📄 摘要(原文)
Biomedical knowledge graphs (KGs) offer structured medical knowledge that can ground large language model (LLM) reasoning in clinical diagnosis application, yet how KG signal should be integrated into LLMs remains an open question. We present a systematic study spanning five KG task formulations, three training paradigms, two KGs, and three base LLMs. At the task level, all paradigms improve over the non-finetuned baseline, but methods with comparable in-domain accuracy show substantially different knowledge transfer behavior. We introduce Gradient Intervention Density (GID) and Gradient Distortion (GD) to measure how broadly an optimizer modifies the pretrained model. GID and GD together reveal a clear divide: KG-judgment training under KL regularization produces sparse, localized updates (a regime we term as surgical alignment), while task-specific SFT produces dense ones. A controlled ablation shows that the objective and KL contribute to sparsity independently, and the paradigms that produce sparse updates also improve reasoning quality, even when their in-domain accuracy is lower than task-specific SFT. Assessing KG-LLM integration thus requires complementing accuracy with optimization-geometry diagnostics. Our implementation can be found at https://github.com/LARK-NLP-Lab/Surgical-Alignment.