INSPIRE: An Internalize-Then-Improve Approach for Example-Driven Mathematical Reasoning
作者: Shuai Wang, Jiayi Kuang, Yinghui Li, Haojing Huang, Xinnian Liang, Ying Shen, Liang Lin
分类: cs.CL
发布日期: 2026-08-27
备注: EMNLP 2026
💡 一句话要点
提出INSPIRE以解决数学推理模型内化不足问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 数学推理 大型语言模型 例子驱动推理 内部化学习 偏好优化
📋 核心要点
- 现有方法主要关注最终答案的正确性,导致模型可能仅仅记忆解决模式,而非真正理解数学概念。
- INSPIRE方法通过参考引导的学生内部化(RGSI)和分阶段的标准偏好训练策略,提升模型的例子驱动推理能力。
- 实验结果表明,INSPIRE在多个模型规模上均有显著提升,甚至超过了更大的开源模型,且未降低一般数学推理能力。
📝 摘要(中文)
数学推理在大型语言模型(LLMs)中取得了快速进展,但现有方法主要优化最终答案的正确性,质疑模型是否真正内化了数学概念。人类数学教育中的基于例子的推理方法,如构造反例以测试定理边界,反映了深刻的概念理解,但在当前LLMs中仍然不够成熟。为此,本文提出INSPIRE,一种内部化-再改进的方法,结合参考引导的学生内部化(RGSI)和分阶段的标准偏好训练策略,旨在提升模型的例子驱动推理能力。实验结果显示,该方法在多个模型规模和家族中均表现出一致的改进,甚至超越了更大的开源模型,同时在分布外基准测试中确认了数学推理能力没有下降。
🔬 方法详解
问题定义:本文旨在解决现有大型语言模型在数学推理中的内化不足问题,现有方法过于依赖最终答案的正确性,缺乏深层次的概念理解。
核心思路:INSPIRE方法通过内部化和再改进的策略,结合参考引导的学生内部化(RGSI),使模型能够生成高质量的偏好候选,并通过分阶段的训练策略逐步提升其例子驱动推理能力。
技术框架:INSPIRE的整体架构包括两个主要模块:第一是RGSI模块,负责生成符合模型自身分布的高质量偏好候选;第二是分阶段的标准偏好训练策略,将学习过程分为方法导向和正确性导向两个阶段。
关键创新:INSPIRE的创新点在于其分阶段的训练策略,允许模型在逐步学习中先掌握例子驱动推理的方法,再学习如何正确应用这些方法,这与现有方法的单一优化目标形成了鲜明对比。
关键设计:在模型训练中,采用了特定的损失函数来平衡方法导向和正确性导向的学习目标,同时在网络结构上进行了优化,以支持RGSI模块的高效运行。该设计确保了模型在学习过程中能够有效地内化数学概念。
🖼️ 关键图片
📊 实验亮点
实验结果显示,INSPIRE在多个模型规模上均实现了显著的性能提升,尤其是在与更大的开源模型的对比中,表现出超过10%的准确率提升。同时,在分布外基准测试中,模型的数学推理能力保持稳定,没有出现性能下降。
🎯 应用场景
该研究的潜在应用领域包括教育技术、智能辅导系统以及数学相关的自动化工具。通过提升模型的例子驱动推理能力,INSPIRE可以帮助学生更好地理解数学概念,促进个性化学习和智能评估,未来可能对教育领域产生深远影响。
📄 摘要(原文)
Mathematical reasoning has seen rapid progress in large language models (LLMs), yet existing methods optimize predominantly for final-answer correctness, raising the question whether models truly internalize mathematical concepts or merely memorize solution patterns. In human mathematics education, example-based reasoning such as constructing counterexamples to test theorem boundaries reflects deep conceptual understanding, but remains underdeveloped in current LLMs. Enhancing this capability through preference optimization presents two key challenges: (1) the model's limited example-based reasoning ability makes constructing effective preference pairs inherently difficult; and (2) capability acquisition is progressive, as the model must first learn to adopt this strategy before learning to apply it correctly. Therefore we propose INSPIRE, an Internalize-Then-Improve approach combining Reference-Guided Student Internalization (RGSI), which produces high-quality preference candidates under the policy model's own distribution, with a stage-wise rubric preference training strategy that decomposes learning into method-oriented and correctness-oriented stages. Experiments across multiple model scales and families demonstrate consistent improvements, even surpassing larger open-source models, while evaluations on out-of-distribution benchmarks confirm no degradation in general mathematical reasoning ability.