Reconstruction: A Blind Benchmark for Recovering Research Ideas from Pre-Publication Bibliographies

📄 arXiv: 2608.16645v1 📥 PDF

作者: Shaolong Chen, Yanlin Fei, Nazhou Liu, Xinmiao Yu, Lei Li, Rahul Thapa, Madalina Ciobanu, Qingqing Mao, Ritankar Das

分类: cs.AI, cs.CL, cs.MA

发布日期: 2026-08-17


💡 一句话要点

提出重建基准以从预出版文献中恢复研究思想

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 研究思想恢复 文献分析 语言模型 反泄露设计 多代理管道

📋 核心要点

  1. 核心问题:现有方法在仅依赖预出版文献时,难以准确恢复论文的研究思想,导致匹配率较低。
  2. 方法要点:提出重建基准,通过严格的反泄露设计,评估模型在无种子论文信息的情况下的假设生成能力。
  3. 实验或效果:七个模型的匹配率在3-15%之间,通过多代理管道的交叉评审,匹配率提升至23-42%。

📝 摘要(中文)

本文探讨了语言模型是否能够仅通过一篇论文的预出版文献恢复其真实研究思想。我们引入了重建基准,这是一种盲目的思想恢复基准,要求模型在不知种子论文及其相关文献的情况下,提出假设,并由独立的大型语言模型评估其与真实思想的匹配程度。通过严格的反泄露协议,包括时间引用截止、匿名参考ID和冻结的每篇论文文献,确保了种子思想的保护。在六个科学领域和643篇论文的评估中,七个前沿模型的匹配率仅为3-15%。我们还评估了一种仅基于参考文献的多代理管道,通过交叉模型评审和瑞士锦标赛选择假设槽,匹配率提升至23-42%,相较于最佳单模型基线提升约2.4倍。

🔬 方法详解

问题定义:本文旨在解决如何在没有种子论文及其相关文献的情况下,准确恢复研究思想的问题。现有方法在这一任务中表现不佳,匹配率普遍较低。

核心思路:论文提出了一种重建基准,要求模型在严格的反泄露条件下生成假设,并通过独立的语言模型进行评估。这种设计旨在消除信息泄露的可能性,从而提高假设生成的准确性。

技术框架:整体架构包括三个主要模块:反泄露协议、假设生成模型和评估模型。反泄露协议确保种子思想不被泄露,假设生成模型负责生成研究思想的假设,而评估模型则对生成的假设进行匹配评估。

关键创新:最重要的技术创新在于引入了严格的反泄露设计,包括时间引用截止、匿名参考ID和冻结文献,这与现有方法的开放性设计形成鲜明对比,有效防止了信息泄露。

关键设计:在参数设置上,采用了多代理管道和瑞士锦标赛选择机制,以提高假设的选择质量和匹配率。损失函数设计上,强调了假设与真实思想之间的匹配度,确保评估的准确性。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

实验结果显示,七个模型的匹配率在3-15%之间,而通过引入多代理管道和交叉模型评审,匹配率提升至23-42%。这一提升幅度约为2.4倍,显著提高了模型在无种子信息情况下的假设生成能力。

🎯 应用场景

该研究的潜在应用领域包括学术研究、文献分析和知识发现等。通过提高研究思想的恢复能力,能够帮助研究人员更好地理解和利用已有文献,从而推动科学研究的进展。未来,该方法可能会在自动化文献综述和智能推荐系统中发挥重要作用。

📄 摘要(原文)

Can a language model recover the true research idea of a published paper when given only that paper's pre-publication bibliography? We introduce Reconstruction, a blind idea-recovery benchmark that withholds the seed paper and all contemporaneous or future literature, and asks models to propose hypotheses that an independent large language model judge matches against the held-out ground-truth idea. A strict anti-leakage protocol-temporal citation cutoff, anonymous reference IDs, and frozen per-paper bibliographies, which prevents prompt-time leakage of the seed idea. Across six scientific domains and 643 evaluated papers, seven frontier models achieve only modest Match rates (approx. 3-15%). We then evaluate a reference-only multi-agent (top 4) pipeline that combines cross-model review with a Swiss tournament over aligned hypothesis slots, without external web search. Cross-model review plus tournament selection raises Match rates to approx. 23-42% across all six domains, which is an observed approx. 2.4x lift over the best single-model baseline. This draft reports the protocol, anti-leakage design, and current results as an arXiv timestamp.