Science Edge Evaluation: SEE the Missing Step Toward Real Scientific Discovery

📄 arXiv: 2608.06931v1 📥 PDF

作者: Taolin Han, Yuchen Zhang, Jinghang Wang, Yun Wu, Wai Yuet Chiu, Zhaohai Li, Yifei Zhang, Jinxin Wang, Yuhao Zhou, Chen Zhao, Jiajia Li, Jiaxin Li, Qile Jin, Kewei Sun, Shuang Wu, Weiqi Zhai, Renquan Lv, Junchao Li, Ruodan Chen, Qingteng Chen, Zhibo Yang, Hu Wei, Lin Qu, Shuai Bai, Bing Zhao

分类: cs.AI

发布日期: 2026-08-07


💡 一句话要点

提出科学边缘评估方法以解决科学发现中的推理不足问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大型语言模型 科学发现 多模态评估 实验推理 工具使用

📋 核心要点

  1. 当前大型语言模型在科学推理中面临的主要挑战是无法可靠地从实验结果中做出有根据的推断。
  2. 本文提出的科学边缘评估(SEE)方法通过多模态基准测试,旨在评估模型在科学发现中的实际应用能力。
  3. 实验结果表明,最佳模型的准确率仅为48.7%,而使用工具后准确率提升至52.7%,但仍未达到可靠推理的标准。

📝 摘要(中文)

大型语言模型(LLMs)在科学发现中的应用日益增加,但其在复杂实验科学中的支持能力仍不明确。本文提出了科学边缘评估(SEE),这是一个基于同行评审文献和实验实践的多模态基准,涵盖化学、生物学和材料科学领域。对19个多模态大型语言模型(MLLMs)的评估显示,即使是表现最佳的模型准确率也仅为48.7%。此外,通用模型的平均表现优于科学专用模型。在视觉代理评估中,工具使用将最佳准确率提高至52.7%。尽管工具使用可以扩展模型可用的信息,但更多信息并不一定导致可靠的科学推理。当前的MLLMs仍无法从实验结果中可靠地做出有根据的推断,这是实际科学发现中的关键能力。

🔬 方法详解

问题定义:本文旨在解决当前大型语言模型在科学发现中推理能力不足的问题,现有方法在处理实验数据时缺乏可靠性和有效性。

核心思路:提出科学边缘评估(SEE)作为多模态基准,结合专家策划的问题和同行评审文献,评估模型在科学领域的推理能力。

技术框架:SEE框架包括问题生成、模型评估和结果分析三个主要模块,旨在全面评估模型在科学推理中的表现。

关键创新:SEE的创新在于其多模态评估方法,强调模型在处理实验数据时的推理能力,与传统的单一文本评估方法有本质区别。

关键设计:在评估过程中,设置了多种实验条件,包括使用工具的情况,以观察其对模型推理能力的影响,同时采用了适应性损失函数来优化模型表现。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,最佳模型的准确率为48.7%,而在使用工具的情况下,准确率提升至52.7%。这一发现表明,尽管工具使用可以扩展信息,但仍未能实现可靠的科学推理,强调了当前模型在科学发现中的局限性。

🎯 应用场景

该研究的潜在应用领域包括科学研究、教育和实验室自动化等。通过提升大型语言模型在科学推理中的能力,SEE可以帮助研究人员更有效地从实验数据中提取有价值的见解,推动科学发现的进程。未来,SEE可能成为科学研究中评估AI工具的重要标准,促进科学与技术的融合发展。

📄 摘要(原文)

Large language models (LLMs) are increasingly involved in scientific discovery, yet it remains unclear whether they can support complex real laboratory science. Here we introduce Science Edge Evaluation (SEE), a multimodal benchmark of expert-curated questions grounded in peer-reviewed literature and experimental practice in chemistry, biology, and materials science. Evaluation of 19 multimodal large language models (MLLMs) shows that even the best-performing model reaches only 48.7% accuracy. Moreover, general-purpose models outperform science-specialized models on average. In the visual-agent evaluation, the use of tools increases the best accuracy to 52.7%. Tool use can expand the information available to models, but more information does not necessarily lead to reliable scientific reasoning. The key challenge is whether models can manage tool-derived information within the boundaries of the original experimental evidence. Together, these findings reveal that current MLLMs still cannot reliably make justified and evidence-bounded inferences from experimental results, which is an essential capability in real scientific discovery. Bridging this gap requires MLLMs to transition from explaining established scientific concepts to deriving novel and evidence-based insights from experimental data.