HalluPeer: A Taxonomy-driven Benchmark for Detecting Hallucinations in Scientific Peer Reviews
作者: Tzu-Ling Lin, Dong-Ting Yao, Teng-Fang Hsiao, Wei-Chih Chen, Hong-Han Shuai
分类: cs.AI, cs.CL
发布日期: 2026-09-03
备注: Accepted to EMNLP Findings 2026
🔗 代码/项目: GITHUB
💡 一句话要点
提出HalluPeer以解决科学同行评审中的幻觉检测问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 幻觉检测 同行评审 大型语言模型 学术诚信 文本验证 自动化过滤 分类法
📋 核心要点
- 现有的幻觉检测方法未针对科学同行评审,导致无法有效验证长篇技术论文中的论断。
- HalluPeer通过构建同行评审特定的幻觉分类法,提供了一个系统化的检测框架,增强了评审的可靠性。
- 在对12000篇论文和38000条评审的实验中,HalluPeer显示出比现有检测器更好的幻觉识别能力。
📝 摘要(中文)
随着学术同行评审规模的扩大,使用大型语言模型(LLMs)作为评审助手的需求日益增加。然而,LLMs可能生成流畅但缺乏支持的论断,从而削弱评审的可靠性。现有的幻觉基准并未针对同行评审设计,而验证需要将论断与长篇技术论文相结合。我们提出了HalluPeer,一个用于检测科学同行评审中幻觉的基准,提供了论文内容、人类撰写的评审和注入幻觉的评审的对齐三元组,并进行了检测、分类和定位的注释。我们的实验表明,现有检测器在区分幻觉与合法批评方面存在困难,而对真实评审的评估显示,HalluPeer定义的幻觉模式在实际评审中确实存在,突显了源意识验证的关键需求。
🔬 方法详解
问题定义:本论文旨在解决在科学同行评审中检测幻觉的问题。现有方法无法有效区分幻觉与合法批评,尤其是在长篇技术论文的背景下。
核心思路:HalluPeer的核心思路是构建一个针对同行评审的幻觉分类法,并通过自动化过滤技术注入幻觉,以便于后续的检测和分类。
技术框架:HalluPeer的整体架构包括三个主要模块:1) 论文内容与评审的对齐;2) 幻觉的注入与分类;3) 检测与验证。该流程确保了幻觉的系统性识别与定位。
关键创新:HalluPeer的主要创新在于其特定于同行评审的幻觉分类法,能够有效识别和分类幻觉,与现有方法相比,提供了更高的准确性和可靠性。
关键设计:在技术细节上,HalluPeer采用了特定的损失函数和网络结构,以优化幻觉的检测性能,并通过对比实验验证了其有效性。具体参数设置和网络架构的设计细节在论文中进行了详细说明。
🖼️ 关键图片
📊 实验亮点
在对12000篇论文和38000条评审的实验中,HalluPeer显示出现有检测器在区分幻觉与合法批评方面的不足,且在真实评审中发现的幻觉模式与HalluPeer定义的模式高度一致,突显了其在源意识验证中的重要性。
🎯 应用场景
HalluPeer的研究成果在学术界具有重要的应用价值,能够帮助提升同行评审的质量和可靠性。通过有效检测幻觉,研究人员可以更好地评估论文的真实贡献,促进科学研究的健康发展。此外,该方法也可扩展至其他领域的文本审核和验证任务。
📄 摘要(原文)
The growing scale of academic peer review has motivated the use of Large Language Models (LLMs) as review assistants, yet LLMs can generate fluent but unsupported claims that undermine review reliability. Existing hallucination benchmarks are not designed for peer review, where verification requires grounding claims in long, technical papers. We introduce HalluPeer, a benchmark for detecting hallucinations in scientific peer reviews, providing aligned triples of paper content, human-written reviews, and hallucination-injected reviews, annotated for detection, classification, and localization. Our pipeline induces a peer-review-specific hallucination taxonomy, identifies review contexts, and injects hallucinations with automated filtering. Experiments on 12K papers and 38K reviews show that existing detectors struggle to separate hallucinations from legitimate critique, while evaluation on authentic reviews demonstrates that HalluPeer-defined hallucination patterns occur in real peer reviews, highlighting the critical need for source-aware verification. Our project page can be found in https://github.com/Lin-TzuLing/HalluPeer.git