RuleWeaver: Benchmarking Rule-Centered Scenario Reasoning for Large Language Models
作者: Bohan Yu, Shi-Yang Li, Pengfei Cao, Jun Zhao, Kang Liu
分类: cs.CL
发布日期: 2026-08-27
备注: Accepted by EMNLP 2026 Findings
🔗 代码/项目: GITHUB
💡 一句话要点
提出RuleWeaver以解决大型语言模型的规则中心场景推理问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 规则推理 场景问答 大型语言模型 基准测试 人工智能 自然语言处理
📋 核心要点
- 现有基准测试未能全面评估大型语言模型在复杂规则推理中的能力,存在明显的不足。
- 论文提出RuleWeaver框架,通过构建规则中心的场景问答实例,增强对规则推理的评估。
- 实验结果显示,当前模型在复杂规则推理上表现不佳,最佳模型的评分仅为最大评分的50%左右。
📝 摘要(中文)
大型语言模型(LLMs)在专业领域的应用日益增多,而有效利用领域知识通常需要在具体场景中推理复杂规则。然而,现有基准测试仅部分评估了这一能力,要么关注输出级别的指令约束,要么忽视规则在场景推理中的不同角色。为了解决这些问题,本文提出了RuleWeaver,一个用于评估规则中心场景推理的基准构建框架。RuleWeaver从语料库派生的IF-THEN元规则开始,逐步将其扩展为复杂规则,并将这些规则组合成规则中心的场景问答实例。除了最终答案的正确性,RuleWeaver还通过基于评分标准的答案质量、规则召回率和规则精确度支持过程级评估。在对11个代表性LLM的实验中,当前模型在复杂规则中心场景推理方面仍然面临挑战,即使是表现最佳的模型也仅达到了最大评分的约50%。
🔬 方法详解
问题定义:本文旨在解决大型语言模型在复杂规则中心场景推理中的不足,现有方法未能有效评估模型的推理能力和规则应用情况。
核心思路:RuleWeaver框架通过构建基于规则的场景问答实例,逐步增强规则的复杂性,从而更全面地评估模型的推理能力。
技术框架:该框架包括从语料库提取IF-THEN元规则、将其扩展为复杂规则,并将这些规则组合成问答实例,支持过程级评估。
关键创新:RuleWeaver的创新在于其规则中心的评估方法,超越了传统的输出级别评估,强调规则在推理过程中的重要性。
关键设计:在设计中,采用了基于评分标准的答案质量评估、规则召回率和规则精确度等指标,以全面评估模型的推理能力。
🖼️ 关键图片
📊 实验亮点
实验结果表明,当前11个代表性大型语言模型在复杂规则中心场景推理方面表现不佳,最佳模型的评分仅达到最大评分的50%。这一发现突显了现有模型在处理复杂规则推理任务中的局限性,呼吁进一步的研究和改进。
🎯 应用场景
该研究的潜在应用领域包括法律、医疗和金融等需要复杂规则推理的专业领域。通过提升大型语言模型在规则推理方面的能力,RuleWeaver有望推动智能问答系统、决策支持系统等的实际应用,提升其在特定领域的有效性和可靠性。
📄 摘要(原文)
Large language models (LLMs) are increasingly applied to specialized domains, where effective use of domain expertise often requires reasoning over complex rules in concrete scenarios. However, existing benchmarks only partially evaluate this capability, as they either focus on output-level instruction constraints or overlook the distinct roles that rules play in scenario reasoning. To address these gaps, this paper introduces RuleWeaver, a benchmark construction framework for evaluating rule-centered scenario reasoning. RuleWeaver starts from corpus-derived IF-THEN Meta Rules, progressively augments them into complex rules, and composes these rules into rule-centered scenario QA instances. Beyond final-answer correctness, RuleWeaver further supports process-level evaluation through rubric-based answer quality, rule recall, and rule precision. Experiments on 11 representative LLMs show that current models still struggle with complex rule-centered scenario reasoning, with even the best-performing model achieving only around 50% of the maximum rubric score. We make our code and dataset available here: https://github.com/SharkSpicy-NLP/RuleWeaver.