HyGRAIL: Cost-Aware and Evidence-Grounded Scientific Hypothesis Discovery over Knowledge Graphs

📄 arXiv: 2609.02056v1 📥 PDF

作者: Yihang Sun, Zhihan Zhu, Zhiyuan Jiang, Jingyi Ge, Zixuan Li, Jiaxuan You

分类: cs.CL

发布日期: 2026-09-02


💡 一句话要点

提出HyGRAIL以解决科学假设发现中的成本与证据问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 科学假设发现 知识图谱 图神经网络 大型语言模型 成本意识 证据基础 多模态学习

📋 核心要点

  1. 现有的科学假设发现方法在处理模糊情况时效率高但可靠性低,导致真实发现稀疏。
  2. HyGRAIL结合了异构GNN筛选与LLM审查,通过GNN评分和路由不确定案例来优化假设发现过程。
  3. 在MatKG数据集上,HyGRAIL的F1分数达到0.429,较基线提升显著,同时减少了LLM调用率54.36%。

📝 摘要(中文)

科学知识图谱组织了从科学文献中提取的实体和关系,但这些图谱本质上是不完整的。缺失的类型链接可能代表合理的科学假设,如材料与应用之间未探索的关联。然而,科学假设发现面临挑战,因为真实发现稀疏且图神经网络(GNN)在模糊情况下效率高但可靠性低,而大型语言模型(LLM)知识丰富但应用成本高且不自然地依赖于图结构。为此,本文提出HyGRAIL,一个成本意识和证据基础的框架,结合了异构GNN筛选与LLM假设审查。HyGRAIL首先使用GNN对候选假设进行评分,识别验证校准的模糊区域,仅将图不确定的案例路由至LLM审查。对于每个路由的假设,HyGRAIL从知识图谱中检索节点级关联和多跳关系路径,并通过模板或LLM自然化将结构化证据转换为自然语言。最后,LLM审查代理使用自然化证据和验证选择的决策标准判断每个困难假设。在MatKG上,HyGRAIL实现了最佳F1分数0.429,较最强基线提高0.242 F1点,较仅使用GNN的基线提高0.322。同时,GNN筛选平均减少了54.36%的LLM调用率。消融研究进一步表明,检索的图证据对可靠的假设验证至关重要,紧凑的双面证据比单纯增加检索数量更有效。

🔬 方法详解

问题定义:本文旨在解决科学假设发现中的成本与证据问题,现有方法在模糊情况下的可靠性不足,导致真实假设稀疏。

核心思路:HyGRAIL通过结合GNN和LLM的优势,首先利用GNN对候选假设进行评分,识别模糊区域,再将不确定的案例路由至LLM进行审查,从而提高假设发现的准确性和效率。

技术框架:HyGRAIL的整体架构包括三个主要模块:GNN评分模块、路由模块和LLM审查模块。GNN模块负责初步筛选和评分,路由模块决定哪些假设需要LLM审查,LLM模块则基于自然化证据进行最终判断。

关键创新:HyGRAIL的主要创新在于将GNN与LLM结合,利用GNN的高效性和LLM的知识丰富性,同时通过路由机制降低了LLM的调用成本,这一设计在现有方法中尚属首次。

关键设计:在GNN模块中,采用了特定的损失函数以优化假设评分;在LLM审查中,使用了模板化和LLM自然化的方式将结构化证据转化为自然语言,确保了信息的准确传递。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

HyGRAIL在MatKG数据集上实现了最佳F1分数0.429,较最强基线提高0.242 F1点,较仅使用GNN的基线提高0.322。同时,GNN筛选显著降低了LLM调用率,平均减少54.36%,显示出其在成本效益上的优势。

🎯 应用场景

HyGRAIL的研究成果在科学研究、材料科学和药物发现等领域具有广泛的应用潜力。通过有效地发现科学假设,该框架能够帮助研究人员识别未探索的关联,推动新材料和新应用的开发,进而加速科学进步和技术创新。

📄 摘要(原文)

Scientific knowledge graphs organize entities and relations extracted from scientific literature, but they remain inherently incomplete. Missing typed links in such graphs can therefore represent plausible scientific hypotheses, such as unexplored associations between materials and applications. However, scientific hypothesis discovery is challenging because true discoveries are extremely sparse among typed candidate pairs: graph neural networks (GNNs) are efficient but unreliable for ambiguous cases, while large language models (LLMs) are knowledgeable but too costly to apply exhaustively and are not naturally grounded in graph structures. We propose HyGRAIL, a cost-aware and evidence-grounded framework that combines heterogeneous GNN triage with LLM-based hypothesis review. HyGRAIL first uses a GNN to score candidate hypotheses and identify a validation-calibrated ambiguous region, routing only graph-uncertain cases to LLM review. For each routed hypothesis, HyGRAIL retrieves node-level associations and multi-hop relational paths from the knowledge graph (KG), then converts this structured evidence into natural language through template-based or LLM-based naturalization. An LLM review agent finally judges each hard hypothesis using the naturalized evidence and validation-selected decision criteria. On MatKG, HyGRAIL achieves the best F1 score of 0.429, improving over the strongest prior baseline by 0.242 F1 points and over the GNN-only baseline by 0.322. Meanwhile, GNN triage reduces the LLM call rate by 54.36% on average. Ablation studies further show that retrieved graph evidence is crucial for reliable hypothesis verification and that compact, two-sided evidence is more effective than simply increasing retrieval quantity.