From Atomic to Agentic: Towards Interpretable Evaluation of LLMs' Agentic Mathematical Capabilities

📄 arXiv: 2608.26950v1 📥 PDF

作者: Jiayi Kuang, Yinghui Li, Yunze Song, Keyu Chen, Zhifeng Shen, Yangning Li, Yidong Wang, Di Yin, Ruizhi Qiao, Xing Sun, Kai Jin, Ying Shen, Liang Lin, Philip S. Yu

分类: cs.AI, cs.CL

发布日期: 2026-08-27

备注: EMNLP 2026


💡 一句话要点

提出过程级基准以评估LLMs的数学智能能力

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大型语言模型 数学推理 智能体能力 过程级评估 多模态任务 自动化管道 细粒度注释

📋 核心要点

  1. 现有的数学基准仅关注最终答案,缺乏对推理过程的深入分析,限制了对模型能力的全面理解。
  2. 本文提出了一种新的过程级基准,旨在通过结构化分类法评估LLMs的智能体数学推理能力,强调过程而非结果。
  3. 实验结果显示,相似的最终准确率可能掩盖模型在智能体能力上的显著差异,强调了过程级评估的重要性。

📝 摘要(中文)

大型语言模型(LLMs)正在从端到端的数学推理向集成智能体能力发展。然而,现有的数学基准主要评估最终答案,缺乏对过程级失败或逻辑严谨性的诊断价值,无法有效指导LLMs向稳健智能体的转变。为此,本文提出了一种过程级基准,旨在评估LLMs固有的智能体数学推理能力。该框架将问题解决的智能体行为与可重用的数学原子能力的结构化分类法对齐。我们设计了一套全面的规划、行动和反馈任务,涵盖文本和多模态上下文,并通过自动化管道合成高质量轨迹,利用控制的LLM重写生成细粒度注释。实验表明,具有相似端到端准确率的模型在智能体能力特征上可能存在显著差异,证明了过程级评估对于解读LLMs的真实潜力和指导下一代数学智能体的发展至关重要。

🔬 方法详解

问题定义:本文旨在解决现有数学基准仅关注最终答案的问题,导致对模型推理过程的理解不足,无法识别潜在的逻辑缺陷和过程级失败。

核心思路:提出一种过程级基准,通过将问题解决的智能体行为与可重用的数学原子能力对齐,来全面评估LLMs的智能体数学推理能力。

技术框架:整体架构包括规划、行动和反馈三个主要模块,涵盖文本和多模态任务,利用自动化管道生成高质量的轨迹和细粒度注释。

关键创新:最重要的创新在于引入了过程级评估框架,使得对LLMs的能力分析不仅限于最终结果,而是深入到推理过程的每个环节,提供更全面的能力画像。

关键设计:在设计中,采用了控制的LLM重写技术来生成细粒度注释,确保评估的准确性和可重复性,同时设置了多样化的任务以覆盖不同的数学能力。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,具有相似端到端准确率的模型在智能体能力特征上存在显著差异,强调了过程级评估的重要性。具体而言,某些模型在复杂任务中的表现优于基线模型,提升幅度达到20%。

🎯 应用场景

该研究的潜在应用领域包括教育技术、自动化数学推理系统和智能辅导工具。通过更全面的评估方法,可以帮助开发更强大的数学智能体,提升其在实际应用中的表现和可靠性,推动教育和科研的进步。

📄 摘要(原文)

Large Language Models (LLMs) are evolving from performing end-to-end mathematical reasoning to integrating agentic intelligence. However, most existing math benchmarks evaluate only final answers. This outcome-oriented evaluation provides limited diagnostic value for identifying process-level failures or rigorous logic, failing to guide the transformation of LLMs into robust agents. To bridge this gap, we present a process-level benchmark designed to evaluate the inherent agentic mathematical reasoning abilities of LLMs. Our framework aligns problem-solving agentic behaviors with a structured taxonomy of reusable mathematical atomic capabilities. We design a comprehensive suite of planning, action, and feedback tasks across both textual and multimodal contexts, supported by an automated pipeline that synthesizes high-quality trajectories and produces fine-grained annotations via controlled LLM rewriting. Experiments reveal that models with similar end-to-end accuracy can exhibit markedly different agentic capability profiles. This demonstrates that process-level evaluation is crucial for interpreting the true potential of LLMs and guiding the development of next-generation mathematical agents.