Scientific Knowledge Discovery in the Age of Large Language Models

📄 arXiv: 2607.26670v1 📥 PDF

作者: Eleni Adamidi, Serafeim Chatzopoulos, Thanasis Vergoulis

分类: cs.DL, cs.AI, cs.CL, cs.IR

发布日期: 2026-07-29

备注: 21 pages, 4 figures


💡 一句话要点

利用生成性大语言模型提升学术文献检索与筛选效率

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 生成性大语言模型 文献检索 候选研究筛选 学术研究 信息检索

📋 核心要点

  1. 核心问题:现有文献检索方法依赖手动查询,效率低且难以处理大量文献。
  2. 方法要点:利用生成性大语言模型自动化文献检索和候选研究筛选,提高灵活性和准确性。
  3. 实验或效果:通过对34篇文献的回顾,展示了生成性LLMs在文献检索中的有效性和适应性。

📝 摘要(中文)

随着学术文献的快速增长,识别相关出版物变得越来越困难,传统搜索系统仍然依赖于手动制定查询和费力的人工检查。生成性大语言模型(LLMs)提供了一种更灵活的替代方案,支持文献检索和候选研究的筛选。本文回顾了34篇应用生成性LLMs于这两项任务的同行评审论文,这些论文通过对OpenAIRE Graph的布尔搜索筛选而来(从1589条记录中筛选出34条)。回顾的研究特征包括使用的LLMs、模型访问与适应、提示和架构技术、真实数据源及评估指标。

🔬 方法详解

问题定义:本文旨在解决在快速增长的学术文献中,如何高效识别和筛选相关出版物的问题。现有方法主要依赖手动查询,导致检索效率低下,且难以处理大量文献。

核心思路:论文提出利用生成性大语言模型(LLMs)来自动化文献检索和候选研究筛选。通过这种方式,研究者可以更灵活地获取相关文献,减少人工干预,提高检索效率。

技术框架:整体架构包括文献检索和候选研究筛选两个主要模块。首先,通过LLMs进行文献检索,接着根据设定的资格标准对候选研究进行筛选。

关键创新:最重要的技术创新在于将生成性LLMs应用于文献检索和筛选任务,显著提高了检索的灵活性和准确性。这一方法与传统的手动查询方式有本质区别。

关键设计:在模型设计上,选择了适合文献检索的LLMs,并进行了相应的适应性调整。使用了特定的提示技术和评估指标,以确保检索结果的相关性和准确性。具体的参数设置和损失函数设计也经过精心选择,以优化模型性能。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

实验结果表明,生成性LLMs在文献检索和筛选任务中表现出色,能够有效提高检索的准确性和效率。与传统方法相比,文献检索的时间成本显著降低,候选研究的筛选准确率也有明显提升,具体性能数据在文中详细列出。

🎯 应用场景

该研究的潜在应用领域包括学术研究、文献管理和信息检索系统。通过提升文献检索和筛选的效率,研究者能够更快地获取相关信息,从而加速科学知识的发现与传播,具有重要的实际价值和未来影响。

📄 摘要(原文)

The rapid growth of scholarly literature has made identifying relevant publications increasingly difficult, and conventional search systems still depend heavily on manually formulated queries and effortful manual inspection. Generative large language models (LLMs) offer a more flexible alternative, supporting literature retrieval and the screening of candidate studies against eligibility criteria. This chapter surveys 34 peer-reviewed papers applying generative LLMs to these two tasks, identified via a Boolean search over the OpenAIRE Graph (1,589 records screened to 34 inclusions). Reviewed studies are characterised by LLMs employed, model access and adaptation, prompting and architectural techniques, ground-truth sources, and evaluation metrics.