From Atomic Evidence to Logical Composition: Structured Compositional Reasoning over Compound Answer Options

📄 arXiv: 2608.12836v1 📥 PDF

作者: Obed Junias, Maria Leonor Pacheco

分类: cs.CL, cs.AI

发布日期: 2026-08-13

备注: 21 pages, 6 figures, 10 tables


💡 一句话要点

提出结构化组合推理框架以解决复合答案选项问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 逻辑推理 复合答案选项 大型语言模型 阅读理解 整数线性规划 对比假设评分 人工智能 自然语言处理

📋 核心要点

  1. 现有大型语言模型在处理复合答案选项时表现不佳,尤其是在需要结合多个原子判断的情况下。
  2. 本文提出了一种框架,通过将复合选项分解为原子答案并评分,避免模型直接处理复合选项。
  3. 实验结果表明,该框架在LOGICAL-COMMONSENSEQA和LOGICAL-SATA上显著提升了模型性能,Macro-F1分别提高了28.7和28.6。

📝 摘要(中文)

大型语言模型在处理需要结合原子判断的复合答案选项时常常失败,即使它们能够正确判断单个原子。本文研究了通过AND、OR和NEITHER/NOR连接的复合选项,提出了一种框架,将每个选项分解为原子答案,并对每个原子进行对比假设评分,从而使模型从未见过复合选项。然后,采用受限整数线性规划将校准后的评分组合成单一预测。我们在LOGICAL-COMMONSENSEQA上进行评估,并引入了LOGICAL-SATA,这是一个基于SATA-Bench的阅读理解基准。我们的框架在经过人工验证的LOGICAL-COMMONSENSEQA分割上将Macro-F1从48.3提高到77.0,在LOGICAL-SATA上从47.0提高到75.6,尤其在NEITHER/NOR上取得了最大增益。

🔬 方法详解

问题定义:本文旨在解决大型语言模型在处理复合答案选项时的不足,尤其是在需要结合多个原子判断的情况下,现有方法无法有效处理这些复杂的逻辑关系。

核心思路:提出的框架通过将复合选项分解为原子答案,并对每个原子进行评分,确保模型在推理时不直接接触复合选项,从而提高推理的准确性。

技术框架:整体架构包括三个主要模块:首先是原子答案的分解,其次是对每个原子的对比假设评分,最后是使用受限整数线性规划将这些评分组合成最终预测。

关键创新:最重要的创新在于引入了一个操作约束的整数线性规划方法,将原子评分有效组合,解决了复合逻辑推理中的复杂性问题,与传统方法相比,显著提升了模型的推理能力。

关键设计:在设计中,采用了特定的损失函数来优化评分的准确性,并通过实验验证了不同参数设置对模型性能的影响,确保了框架的有效性和鲁棒性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,提出的框架在LOGICAL-COMMONSENSEQA上将Macro-F1从48.3提升至77.0,在LOGICAL-SATA上从47.0提升至75.6,尤其在NEITHER/NOR选项上取得了显著的性能提升,表明该方法在复杂逻辑推理中的有效性。

🎯 应用场景

该研究的潜在应用领域包括自然语言理解、智能问答系统和复杂推理任务等。通过提升模型在逻辑推理方面的能力,能够更好地支持人机交互、自动化决策和知识推理等实际应用,未来可能对人工智能的智能化水平产生深远影响。

📄 摘要(原文)

Large language models often fail when answer options require combining atomic judgments under explicit logical operators, even when they judge the individual atoms correctly. We study compound options connected by AND, OR, and NEITHER/NOR, introducing a framework that decomposes each option into atomic answers and scores contrastive hypotheses about each one, so the model never sees a compound option. An operator-constrained integer linear program then composes the calibrated scores into a single prediction. We evaluate on LOGICAL-COMMONSENSEQA and introduce LOGICAL-SATA, a reading-comprehension benchmark derived from SATA-Bench. Our framework improves Macro-F1 from 48.3 to 77.0 on the human-validated LOGICAL-COMMONSENSEQA split and from 47.0 to 75.6 on LOGICAL-SATA, with the largest gains on NEITHER/NOR.