Beyond Factual Knowledge: Benchmarking and Learning Step-Level Procedural Rule Reasoning in Large Language Models

📄 arXiv: 2608.22753v1 📥 PDF

作者: Bohan Yu, Pengfei Cao, Chen Han, Chenxi Zhou, Zhiheng Zhang, Zhiyang Xie, Wenhao Teng, Xiangwen Liao, Jun Zhao, Kang Liu

分类: cs.CL

发布日期: 2026-08-24

备注: Accepted by EMNLP 2026 Findings

🔗 代码/项目: GITHUB


💡 一句话要点

提出DynaRule框架以提升大语言模型的程序规则推理能力

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 程序规则推理 动态重关注 大型语言模型 多步推理 智能问答系统

📋 核心要点

  1. 现有大型语言模型在处理大规模程序规则时面临理解和应用的困难,尤其是在多步推理场景中表现不佳。
  2. 本文提出DynaRule框架,通过动态重关注和更新机制,使模型能够在推理过程中灵活应用相关规则,提升推理稳定性。
  3. 实验结果显示,DynaRule在RuleWorld基准测试中,平均问答准确率提高了19个百分点,且在10K规则下Recall@1超过85%。

📝 摘要(中文)

大型语言模型(LLMs)在文本理解和生成方面表现出色,但在可靠理解和应用外部提供的程序规则方面仍存在挑战。为评估这一能力,本文引入了RuleWorld,一个将规则重构为全球可重用抽象单元的大规模基准测试。在RuleWorld中,涵盖了单规则、并行多规则和多跳推理等多种场景,以进行全面评估。我们进一步提出了DynaRule,一个端到端框架,通过将给定规则注入KV缓存,将检索转变为内部可学习的逐步过程。实验结果表明,DynaRule在10K规则下的平均问答准确率提高了19个百分点,且Recall@1超过85%,显著优于强基线。

🔬 方法详解

问题定义:本文旨在解决大型语言模型在处理外部程序规则时的理解和应用能力不足的问题。现有方法在面对大规模规则池时,模型的推理能力显著下降,导致准确率降低。

核心思路:DynaRule框架的核心思想是将给定的程序规则注入KV缓存,并通过逐步学习的方式进行动态检索和应用。通过这种设计,模型能够在推理过程中动态更新和重关注最相关的规则,从而提升多步推理的稳定性和准确性。

技术框架:DynaRule的整体架构包括规则注入模块、KV缓存管理、动态重关注机制和逐步推理模块。规则注入模块负责将外部规则转化为可用格式,KV缓存管理则确保规则的高效存储和检索。动态重关注机制通过引入特殊的标记,使模型在推理过程中能够灵活调整关注的规则。

关键创新:DynaRule的主要创新在于其动态重关注机制,允许模型在推理过程中根据当前上下文动态更新关注的规则。这一设计与传统方法的静态规则应用形成鲜明对比,显著提升了模型在复杂推理任务中的表现。

关键设计:DynaRule采用了分层的注意力机制,结合了特定的损失函数以优化规则的选择和应用。此外,模型的参数设置经过精心调整,以确保在大规模规则池中仍能保持高效的推理能力。通过这些设计,DynaRule能够在多步推理中实现更高的准确率和稳定性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在RuleWorld基准测试中,DynaRule显著提升了大型语言模型的性能,平均问答准确率提高了19个百分点,并在10K规则下实现了超过85%的Recall@1,表现优于多种强基线,证明了其有效性和实用性。

🎯 应用场景

该研究的潜在应用领域包括智能问答系统、自动化决策支持和复杂任务规划等。通过提升大型语言模型在程序规则推理方面的能力,DynaRule能够为各类应用提供更为可靠的支持,推动智能系统在实际场景中的应用和发展。

📄 摘要(原文)

Large language models (LLMs) excel at text understanding and generation, yet still struggle to reliably understand and apply externally provided procedural rules at scale. To evaluate this capability, we introduce RuleWorld, a large-scale benchmark that reformulates rules as globally reusable abstract units rather than instance-specific facts. In RuleWorld, several scenarios, including single-rule, parallel multi-rule, and multi-hop reasoning, are settled for comprehensive evaluation. We further propose DynaRule, an end-to-end framework that injects the given rules into the KV cache and turns retrieval into an internal, learnable, step-wise process. Specifically, DynaRule employs Stacked Step-Level Attention Training with a special token to enable dynamic rule re-attention and updating during inference. In this way, the model can re-attend to the most relevant rules at each step, dynamically replacing outdated ones to support more stable multi-step reasoning. Experiments on RuleWorld show that existing LLMs face challenges under large rule pools, while DynaRule improves average QA accuracy by up to 19 points and achieves over 85% Recall@1 at 10K rules, outperforming strong baselines by large margins. We make our code and dataset available here: https://github.com/SharkSpicy-NLP/Beyond-Factual-Knowledge.