Self-prompting and cross-model consensus enable reproducible data extraction from scientific literature with large language models
作者: Valentin Romanov, Monique Bax, Steven Niederer
分类: cs.AI, cs.DB
发布日期: 2026-08-19
💡 一句话要点
利用自提示与跨模型共识实现科学文献数据提取的可重复性
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 数据提取 大型语言模型 自提示 跨模型共识 科学文献 人工智能 机器学习
📋 核心要点
- 现有方法在提取科学文献中的细微数据时,常常面临上下文理解不足和信息遗漏的问题。
- 论文提出通过自提示和跨模型共识的方式,提升大型语言模型在数据提取中的表现,减少对专家的依赖。
- 实验结果表明,LLMs在数据提取的准确性上接近人类专家,但仍需人类参与以解决争议案例。
📝 摘要(中文)
准确提取研究文章中的细微、上下文相关数据是一项繁琐且耗时的任务。本文研究了前沿的基于浏览器的大型语言模型(LLMs)在提取高度上下文信息方面的表现。我们展示了四个逐步提升的工作流程:1)在专家策划的提示和研究文章下,大多数前沿LLMs在数据提取方面表现良好,但在解释科学上下文和细微差别时存在困难;2)在简单指令下,LLMs能够自主生成提示,其效果几乎与专家撰写的提示相当;3)自主发现研究文献较为困难,代理要么遗漏要么虚构参考文献;4)LLMs能够根据已发布的指南创建新的数据集,与人类专家评审者的判断高度一致,但仍需人类参与。综合这些发现,定义了一个可审计的劳动分工,其中专家指定证据标准,模型交叉检查重复提取,研究人员解决争议案例,为在不放弃专家监督的情况下扩展科学数据策划提供了实用途径。
🔬 方法详解
问题定义:本文旨在解决从科学文献中准确提取上下文相关数据的挑战,现有方法在理解科学上下文和细微差别方面存在不足,导致信息提取不准确。
核心思路:通过自提示机制,LLMs能够根据简单指令生成有效的提取提示,从而提高数据提取的效率和准确性。同时,跨模型共识机制确保了提取结果的可靠性。
技术框架:整体流程包括四个阶段:1)专家提供的提示与文献结合;2)LLMs生成自提示;3)模型间的交叉验证;4)人类专家审核争议结果。每个阶段都旨在提升数据提取的准确性和可重复性。
关键创新:最重要的创新在于结合自提示与跨模型共识的策略,使得LLMs在数据提取中能够自主生成有效提示,并通过模型间的验证提高结果的可靠性。与传统方法相比,这种方法显著减少了对专家的依赖。
关键设计:在模型训练中,采用了特定的损失函数来优化提示生成的质量,并设计了多层次的验证机制,以确保提取结果的准确性和一致性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,LLMs在数据提取的准确性上与人类专家的判断高度一致,尤其在使用自提示生成的情况下,提取效果几乎与专家提示相当。此外,模型间的交叉验证显著提高了提取结果的可靠性,减少了信息遗漏和虚构的情况。
🎯 应用场景
该研究的潜在应用领域包括科学研究、数据挖掘和文献综述等。通过提升数据提取的效率和准确性,能够加速科学发现和知识传播,未来可能对科研工作流程产生深远影响。
📄 摘要(原文)
Accurately extracting nuanced, contextualized data from research articles is laborious and time intensive. Here, we investigate the performance of frontier, browser-based large language models (LLMs) to extract highly contextualized information. We demonstrate four escalating workflows, 1) given an expert curated prompt and research articles, most frontier LLMs perform well at data extraction, however can struggle with interpreting scientific context and nuance, 2) given simple instructions, LLMs can author their own prompts which were almost as eNective as expert-written prompts, 3) autonomous discovery of research literature was diNicult, agents either missed or hallucinated references, and 4) LLMs can create new datasets from published guidelines that closely match human-expert judges, but still require a human-in-the-loop. Together, these findings define an auditable division of labour in which experts specify the evidence standard, models cross-check repeated extractions and researchers resolve disputed cases, providing a practical route to scaling scientific data curation without relinquishing expert oversight.