Do LLMs Know a Good Hypothesis When They See One? Logit-Based Energy Scoring Outperforms Prompted LLM-as-Judge for Scientific Hypothesis Ranking
作者: Swati Rajwal, Sanjay Das, Tirthankar Ghosal
分类: cs.AI
发布日期: 2026-08-18
💡 一句话要点
提出基于logit的能量评分方法以提升科学假设评估
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大型语言模型 科学假设评估 logit能量评分 内在信心 可信AI 假设生成 模型评估
📋 核心要点
- 现有方法在科学假设评估中存在偏向熟悉想法的问题,难以有效识别新颖假设。
- 本文提出了一种基于logit的能量评分方法,利用语言模型的内在信心进行假设评估,避免了比较判断的局限性。
- 实验结果表明,基于内在评分的方法在Hit@1上达到了33.0%,显著优于传统的提示式排名方法。
📝 摘要(中文)
大型语言模型(LLMs)在科学假设生成中越来越受到重视,但评估生成的假设仍然是一个挑战。现有方法通常使用LLMs作为评判者或依赖语义相似性,这可能偏向于熟悉的想法而非新颖的观点。本文提出了一种基于logit的能量评分方法,利用语言模型的内在信心来评估假设,而非进行比较判断。我们在12个学科的1,323篇论文上对七种语言模型进行了基准测试,结果显示内在评分的Hit@1达到了33.0%,而提示式列表排名仅为16.6%。最强配置为一个10亿参数的模型,使用logit能量评分达到了53.1%。整体来看,内在模型信心在科学假设评估中显示出潜力,并激励未来在可信AI驱动的科学发现中的信心基础方法研究。
🔬 方法详解
问题定义:本文旨在解决科学假设评估中的信任问题,现有方法往往依赖于LLMs作为评判者或语义相似性,可能导致对新颖假设的忽视。
核心思路:提出基于logit的能量评分方法,通过评估语言模型的内在信心来判断假设的质量,避免了传统方法的比较性偏见。
技术框架:整体流程包括假设生成、内在信心评分和结果评估三个主要模块。首先生成假设,然后通过模型计算其logit值,最后根据评分结果进行排序。
关键创新:最重要的创新在于使用内在信心评分替代传统的比较判断方法,这一设计使得模型能够更好地识别新颖的科学假设。
关键设计:在实验中使用了多种参数设置和模型架构,特别是10亿参数的模型在logit能量评分下表现最佳,达到了53.1%的Hit@1。
🖼️ 关键图片
📊 实验亮点
实验结果显示,基于内在信心的logit能量评分方法在Hit@1上达到了33.0%,而传统的提示式排名方法仅为16.6%。最优配置的10亿参数模型在评分中达到了53.1%的Hit@1,显示出显著的性能提升。
🎯 应用场景
该研究的潜在应用领域包括科学研究、假设生成与评估、以及可信AI系统的开发。通过提高假设评估的准确性,能够促进科学发现的效率和质量,推动各学科的研究进展。
📄 摘要(原文)
Large language models (LLMs) are increasingly used for scientific hypothesis generation. However, evaluating generated hypotheses remains a challenge for trustworthy AI-enabled scientific workflows. Existing approaches often use LLMs as judges or rely on semantic similarity, which can favor familiar ideas over novel ones. We propose a logit-based energy scoring method that evaluates hypotheses using a language model's intrinsic confidence rather than comparative judgment. We benchmarked seven language models on 1,323 papers across 12 disciplines. Each paper was paired with its hypothesis and fifteen incorrect alternatives. Intrinsic scoring reached 33.0% Hit@1 pooled across both scorers, compared with 16.6% for prompted listwise ranking. The strongest configuration, a 1-billion-parameter model using logit-based energy scoring, reached 53.1%, though this was the maximum across 14 model-by-scorer combinations selected post hoc. Overall, intrinsic model confidence shows potential for scientific hypothesis evaluation. This study also motivates future research on confidence-based methods for trustworthy AI-enabled scientific discovery.