When Absence Is Evidence: Evaluating Completeness-Sensitive Negative Reasoning in Large Language Models

📄 arXiv: 2608.04591v1 📥 PDF

作者: Byoungjae Min, Kennedy Edemacu, Sae-Hong Cho, Yoonhyuk Choi, Beakcheol Jang, Jong Wook Kim

分类: cs.CL, cs.AI

发布日期: 2026-08-05

备注: 19 pages, 2 figures, 20 tables


💡 一句话要点

提出CROWN-QA以解决大语言模型的完整性敏感负推理问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大语言模型 负推理 信息检索 问答系统 模型评估

📋 核心要点

  1. 现有的大语言模型在判断信息缺失时,常常无法准确区分合理的负面回答与不足的证据,导致判断不稳定。
  2. 本文提出CROWN-QA,通过CROWN-Synth和CROWN-Real两部分,系统评估模型在完整性敏感负推理中的表现,旨在提高判断的准确性。
  3. 实验结果显示,模型在处理部分覆盖的证据时存在不对称性,且不同模型、提示和数据源的表现差异显著。

📝 摘要(中文)

大语言模型(LLMs)常被询问某些信息是否缺失于记录、列表或检索的上下文中。然而,非观察仅在证据完全覆盖查询范围时才允许负面回答;否则,答案应保持未知。我们称之为完整性敏感负推理。本文引入CROWN-QA,包括CROWN-Synth和CROWN-Real,前者通过固定问题和观察事实,仅变化查询相关覆盖度,后者则是对真实文档的对比集评估。实验表明,模型在闭合判断上表现不稳定,且存在显著的过闭合现象,未能可靠地区分合理的负面回答与不足的证据。CROWN-Real的实验结果显示,核心的部分覆盖不对称性在真实文档内容中依然存在。

🔬 方法详解

问题定义:本文旨在解决大语言模型在完整性敏感负推理中的判断不稳定性,现有方法未能有效区分合理的负面回答与不足的证据,导致过闭合和欠闭合现象。

核心思路:论文提出CROWN-QA,通过构建CROWN-Synth和CROWN-Real,系统化地评估和分析模型在不同覆盖度下的表现,旨在提高模型的判断准确性。

技术框架:CROWN-QA包含两个主要模块:CROWN-Synth用于生成控制的配对核心,固定问题和观察事实,仅变化查询相关覆盖度;CROWN-Real则是对真实文档的对比集评估,控制覆盖度的变体。

关键创新:最重要的技术创新在于引入了完整性敏感负推理的概念,并通过CROWN-QA系统化地评估模型在此方面的表现,揭示了模型在处理部分覆盖证据时的非对称性。

关键设计:在实验设计中,采用了结构化证书引导来追踪错误,设置了不同的覆盖度变体,并使用了多种提示策略来评估模型的反应。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

实验结果表明,模型在处理完整性敏感负推理时存在显著的过闭合现象,尤其在CROWN-Synth中,模型未能有效区分合理的负面回答与不足的证据。CROWN-Real的评估显示,部分覆盖不对称性在真实文档中依然存在,且不同模型的表现差异显著。

🎯 应用场景

该研究的潜在应用领域包括信息检索、问答系统和对话系统等,能够提升模型在处理缺失信息时的判断能力,进而提高用户体验和系统的可靠性。未来,该研究可能推动更智能的语言理解和推理能力的发展。

📄 摘要(原文)

Large language models (LLMs) are often asked whether something is absent from a record, list, or retrieved context. Yet non-observation licenses a negative answer only when evidence completely covers the query scope; otherwise, the answer should remain unknown. We call this completeness-sensitive negative reasoning. We introduce CROWN-QA, comprising CROWN-Synth, a controlled paired core that fixes the question and observed facts while varying only query-relative coverage, and CROWN-Real, a real-document contrast-set evaluation with controlled coverage variants. Across three LLM families, models show unstable closure judgments and substantial over-closure, failing to reliably distinguish a justified negative answer (Certified-Negative) from insufficient evidence (Unknown). The dominant CROWN-Synth failure is asymmetric: models often recognize implicitly complete evidence yet treat implicitly partial evidence as query-covering. Prompting redistributes errors between over- and under-closure rather than consistently resolving them. Structured certificate elicitation traces many errors to evidence-coverage mischaracterization. CROWN-Real shows that the core partial-coverage asymmetry persists on real-document content, while its strength and the balance between over- and under-closure vary by model, prompt, and source.