DERELAB: Probing Defeasible Reasoning and Confirmation Bias in LLMs with a Generative Benchmark

📄 arXiv: 2608.30413v1 📥 PDF

作者: Jayanta Sadhu, Sayem Shahad, Kenneth Marino

分类: cs.AI

发布日期: 2026-08-31

备注: Accepted at the 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP 2026)


💡 一句话要点

提出DeReLab框架以研究大型语言模型中的可撤销推理与确认偏差

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 可撤销推理 确认偏差 大型语言模型 生成框架 信念更新 自然语言处理 实验设计

📋 核心要点

  1. 现有研究在可撤销推理方面的数据集静态且缺乏对非单调推理类别的广泛覆盖,限制了模型评估的有效性。
  2. 本文提出DeReLab框架,通过参数化图结构生成多轮对话,允许对模型在确认偏差下的反应进行控制和测量。
  3. 实验结果显示,几乎所有评估的语言模型都倾向于接受一致证据,且在面对不一致证据时表现出抵制,揭示了确认偏差的普遍性。

📝 摘要(中文)

可撤销推理是一种基于当前证据进行推理的方式,但在新证据出现时可以被撤回。尽管已有研究探讨了语言模型在可撤销推理中的表现,但现有数据集静态且覆盖面不足。本文提出DeReLab,一个生成框架,通过参数化图结构生成多轮信念更新对话,并在每轮提供经过形式验证的真实答案,从而控制模型对确认和否定证据的反应。通过对九个大型语言模型的评估,发现几乎所有模型都表现出接受一致证据而抵制不一致更新的系统性倾向,部分模型能够识别削弱更新但未能修正结论。我们的研究将促进未来对语言模型在可撤销推理中的评估。

🔬 方法详解

问题定义:本文旨在解决现有可撤销推理研究中数据集静态且覆盖面不足的问题,导致模型评估的局限性。

核心思路:提出DeReLab框架,通过生成多轮信念更新对话,结合形式验证的真实答案,控制模型对不同证据的反应,进而研究确认偏差。

技术框架:DeReLab框架包括参数化图结构生成模块、信念更新对话生成模块和形式验证模块,确保每轮对话的准确性和可控性。

关键创新:最重要的创新在于通过生成对话的方式,系统性地测量模型在确认与否定证据下的反应,填补了现有研究的空白。

关键设计:在设计中,采用了参数化图结构来表示推理关系,并通过形式验证确保每轮对话的真实答案,增强了实验的可靠性。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果表明,评估的九个大型语言模型几乎全部表现出接受一致证据的倾向,且在面对不一致证据时存在显著的抵制行为。这一发现揭示了确认偏差在语言模型中的普遍性,为未来的研究提供了重要的实验基础。

🎯 应用场景

该研究的潜在应用领域包括自然语言处理中的推理系统、智能助手和决策支持系统。通过深入理解语言模型的推理能力,可以提升其在复杂任务中的表现,推动人工智能的进一步发展。

📄 摘要(原文)

Defeasible reasoning is a type of reasoning where inferences are drawn from plausible current evidence, but can be retracted upon the introduction of newer evidence. Although recent studies have examined language-model behaviors in defeasible reasoning, the datasets have been static and lack wide coverage of non-monotonic reasoning categories. We introduce DeReLab, a generative framework that produces multi-turn belief-updating conversations from parameterized graph structures across default and inheritance reasoning, with formally verified ground truth at every turn, enabling controlled measurement of how models respond to confirming and disconfirming evidence. This controlled generation process creates a testbed for experimental designs that isolate specific reasoning demands. Applying this capability to the study of confirmation bias, we evaluate nine open and proprietary large language models and find that nearly all exhibit a systematic tendency to accept congruent evidence while resisting incongruent updates, with several models correctly identifying a weakening update yet failing to revise their conclusion. We believe our work and findings will facilitate future research on evaluating language models in defeasible reasoning.