AutoSupervision: Closing the Feedback Loop in Scientific Workflows with Grounded Revision Verification

📄 arXiv: 2607.27845v1 📥 PDF

作者: Haobo Li, Eunseo Jung, Wenxiao Zhao, Feng Liu, Jiong Wang, Kaiyi Xu, Zijie Guo, Zixin Chen, Ben Fei, Fenghua Ling, Lei Bai

分类: cs.CL, cs.AI

发布日期: 2026-07-30


💡 一句话要点

提出AutoSupervision以验证科学工作流中的反馈有效性

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 科学工作流 反馈验证 大型语言模型 同行评审 证据支持

📋 核心要点

  1. 核心问题:现有的AI辅助科学工作流缺乏有效验证审稿人反馈是否促进手稿改进的能力。
  2. 方法要点:提出AutoSupervision,通过审稿记录、作者回应和修订手稿的证据来评估反馈的有效性。
  3. 实验或效果:实验结果显示,LLMs在识别审稿人关注点方面表现良好,但基于证据的验证仍需改进,最佳得分为0.501。

📝 摘要(中文)

近年来,大型语言模型(LLMs)的进步使得人工智能系统能够辅助科学研究和同行评审。然而,可靠的AI辅助科学工作流中一个重要能力尚未得到充分探索:验证审稿人反馈是否真正促成了有意义且有证据支持的手稿改进。我们提出了AutoSupervision,它通过基于证据的方式评估科学手稿修订是否真正解决了审稿人提出的问题。AutoSupervision利用透明的同行评审记录作为自然的监督来源,审稿人评论明确了科学问题,作者回应描述了声称的解决方案,而修订后的手稿则提供了变化的证据。我们从56000篇《自然通讯》文章及其对应的审稿记录构建了AutoSupervision,并对LLMs进行了实验、消融研究和案例研究。结果表明,尽管LLMs在识别审稿人关注点方面表现良好,但基于证据的验证仍然是主要瓶颈,最佳模型的得分仅为0.501。

🔬 方法详解

问题定义:论文要解决的问题是如何验证审稿人反馈是否真正导致了手稿的有效改进。现有方法在这一验证过程中缺乏透明性和有效性,导致无法确保反馈的实际影响。

核心思路:论文的核心思路是利用透明的同行评审记录作为监督来源,通过分析审稿人评论、作者回应和修订后的手稿,来评估反馈的有效性。这种方法旨在建立一个闭环反馈机制,确保修订是基于真实的证据。

技术框架:整体架构包括三个主要模块:审稿人评论分析模块、作者回应分析模块和修订手稿证据提取模块。模型需要从这些模块中提取信息,以判断审稿人关注点是否得到解决,并识别支持性证据。

关键创新:最重要的技术创新点在于将透明的审稿记录作为监督信号,建立了一个新的验证框架,区别于传统的仅依赖于作者自我报告的方式。

关键设计:在技术细节上,模型的参数设置和损失函数设计旨在优化对审稿人关注点的识别和证据的提取,具体的网络结构和训练策略则根据56000篇文章的特征进行了调整。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,LLMs在识别审稿人关注点方面表现良好,GPT-5.5模型的得分达到0.754。然而,基于证据的验证仍是主要瓶颈,最佳模型的得分仅为0.501,显示出在这一领域的进一步改进空间。

🎯 应用场景

该研究的潜在应用领域包括科学出版、同行评审和AI辅助研究等。通过提供有效的反馈验证机制,AutoSupervision可以提高科学研究的质量和透明度,促进更可靠的学术交流。未来,随着技术的进步,该方法可能会扩展到其他领域,如技术审查和政策评估等。

📄 摘要(原文)

Recent advances in large language models (LLMs) have enabled AI systems to assist scientific research and peer review. However, an essential capability for reliable AI-assisted scientific workflows remains underexplored: verifying whether reviewer feedback leads to meaningful and evidence-supported manuscript improvements. We introduce AutoSupervision, which evaluates whether scientific manuscript revisions genuinely address reviewer concerns through grounded evidence. AutoSupervision leverages transparent peer-review records as a natural source of supervision, where reviewer comments specify scientific concerns, author responses describe claimed resolutions, and revised manuscripts provide evidence of changes. Given reviewer comments, author responses, and revised manuscripts, models must characterize reviewer concerns, determine whether concerns have been addressed, and identify supporting manuscript evidence. We construct AutoSupervision from 56,000 Nature Communications articles and corresponding review records. Then we conducted experiments on LLMs, the ablation study, and the case study. Our results show that while LLMs perform well in characterizing reviewer concerns, with GPT-5.5 achieving a score of 0.754, evidence-based verification remains the primary bottleneck, with the best-performing model reaching only 0.501.