Ask, Condition or Abstain: Reinforcement Learning for Missing-Premise Reasoning
作者: Yongqi Tong, Zhenyu Zhang, Zimi Liu, Kewei Fu, Mingli Song, Haofei Zhang, Junshao Zhang, Hong Zhu, Jiang-Ming Yang, Xin Zhang, Jianshe Li
分类: cs.CL
发布日期: 2026-08-17
💡 一句话要点
提出ACA-RL框架以解决缺失前提推理问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 缺失前提推理 强化学习 自然语言处理 问答系统 数据增强 结构化奖励 模型评估
📋 核心要点
- 现有的答题强化学习方法主要训练模型解决完全指定的问题,缺乏处理缺失前提的能力。
- 本文提出ACA-RL框架,通过数据增强和结构化奖励机制,训练模型在缺失前提的情况下进行推理。
- 实验结果表明,ACA-RL在缺失前提基准MPB上表现优异,同时在传统推理任务中保持竞争力。
📝 摘要(中文)
答题强化学习(RL)训练推理模型以解决完全指定的问题,但许多现实查询省略了唯一答案所需的前提。在这种情况下,有用的回应不总是拒绝:模型应询问缺失的前提、将答案条件化于未知量,或在没有信息性条件响应时选择放弃。本文提出了 extit{Ask-Condition-Abstain Reinforcement Learning}(ACA-RL),这是一个数据增强的RL框架。其推理图引导的流程将良好构造的问题转换为缺失前提的训练实例,并进行局部缺口标注;ACA-RL随后在这些实例上进行训练,并对五种可观察的响应行为进行结构化奖励。我们还引入了 extit{Missing-Premise Benchmark}(MPB),这是一个包含274个实例的人类验证基准,涵盖数学、逻辑和现实世界问题。在Qwen3和Llama模型上,ACA-RL在MPB上持续改善,同时在良好构造的推理任务上保持竞争性能。结合发布的代码、MPB和训练数据,该研究支持NLP评估的新使命:衡量模型是否能够识别任务的不确定性并处理不确定性,而不仅仅是回答完全指定的问题。
🔬 方法详解
问题定义:本文旨在解决缺失前提推理问题,现有的答题强化学习方法无法有效处理缺失信息的情况,导致模型在面对不完整问题时表现不佳。
核心思路:ACA-RL框架通过引入询问、条件化和放弃三种响应策略,使模型能够在缺失前提的情况下进行合理推理,从而提升模型的灵活性和适应性。
技术框架:ACA-RL的整体架构包括推理图引导的流程、缺失前提实例生成、结构化奖励机制等模块。首先,将良好构造的问题转化为缺失前提的训练实例,并进行局部缺口标注;然后,模型在这些实例上进行训练。
关键创新:最重要的技术创新在于引入了缺失前提的训练实例和结构化奖励机制,使得模型能够在面对不确定性时做出更为合理的响应。这与传统的强化学习方法有本质区别。
关键设计:在设计上,ACA-RL使用了多种奖励信号来引导模型学习不同的响应行为,并通过数据增强技术生成多样化的训练实例,以提升模型的泛化能力。
🖼️ 关键图片
📊 实验亮点
实验结果显示,ACA-RL在缺失前提基准MPB上取得了显著提升,相较于基线模型在多个任务上均有超过10%的性能提升,同时在良好构造的推理任务中保持了竞争力,验证了其有效性。
🎯 应用场景
该研究的潜在应用领域包括自然语言处理中的问答系统、智能助手和教育技术等。通过提升模型对缺失信息的处理能力,ACA-RL能够在更复杂的真实场景中提供更为准确和灵活的响应,具有重要的实际价值和未来影响。
📄 摘要(原文)
Answer-only reinforcement learning (RL) trains reasoning models to solve fully specified problems, but many realistic queries omit a premise needed for a unique answer. In this setting, the useful response is not always refusal: the model should ask for the missing premise, condition its answer on the unknown quantity, or abstain when no informative conditional response is available. We present \emph{Ask-Condition-Abstain Reinforcement Learning} (ACA-RL), a data-augmented RL framework for this setting. Its reasoning-graph-guided pipeline converts well-posed problems into missing-premise training instances with localized gap annotations; ACA-RL then trains on these instances with a structured reward over five observable response behaviors. We also introduce the \emph{Missing-Premise Benchmark} (MPB), a 274-instance human-verified benchmark spanning mathematical, logical, and real-world word problems. Across Qwen3 and Llama models, ACA-RL consistently improves on MPB while preserving competitive performance on well-posed reasoning tasks. Together with the released code, MPB, and training data, this work supports a new mission for NLP evaluation: measuring whether models can recognize when a task is underdetermined and handle uncertainty, not only whether they can answer fully specified questions.