Self-Improving Large Language Models via Progressive Experience Evolution
作者: Shijie Ren, Xiting Wang, Meng Li, Yujie Guo, Yunhang Yao, Ziheng Peng, Xunlong Wang, Yuetan Chen, Haoyang Zhou, Yunlong Liang, Fandong Meng
分类: cs.CL, cs.AI, cs.LG
发布日期: 2026-08-03
备注: 10 pages, 5 figures
🔗 代码/项目: GITHUB
💡 一句话要点
提出SPEE框架以解决自我提升语言模型的经验转化问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 自我提升 经验蒸馏 语言模型 强化学习 策略优化 数学推理 模型能力
📋 核心要点
- 现有自我提升方法在经验转化方面存在碎片化,难以有效内化经验为模型能力。
- 提出SPEE框架,通过显式经验演化和隐式策略优化,解决经验转化问题。
- 在五个数学推理基准上,SPEE在不同模型规模下均表现优异,超越了测试时和训练时的自我演化基线。
📝 摘要(中文)
大型语言模型(LLMs)实现自我提升不仅需要有效的策略优化,还需将瞬时交互经验转化为持久的模型能力。现有自我提升方法存在碎片化问题:测试时方法能够显式提取经验,但无法将其内化为模型参数;而训练时优化方法则可以更新模型参数,但缺乏积累可转移经验的显式机制。为此,本文提出了SPEE(自我渐进经验演化)框架,统一了显式经验演化与隐式策略优化的过程。通过对多次交互收集的轨迹进行反思,SPEE提取并逐步演化可转移经验,并通过特权引导的在线自蒸馏(OPSD)将其内化到策略中。实验表明,SPEE在五个数学推理基准上均优于现有自我演化基线。
🔬 方法详解
问题定义:本文旨在解决大型语言模型在自我提升过程中,如何有效地将瞬时交互经验转化为持久的模型能力的问题。现有方法在经验提取与内化方面存在明显的不足,导致模型无法充分利用交互经验。
核心思路:论文提出的SPEE框架通过引入显式经验演化和隐式策略优化的结合,旨在有效提取和内化可转移经验,从而提升模型的自我改进能力。这样的设计使得模型能够在不同的交互中不断积累和优化经验。
技术框架:SPEE框架分为两个主要阶段:显式经验演化和隐式策略优化。在显式经验演化阶段,模型从多次交互中收集轨迹,提取和验证可转移经验,并将其内化到策略中。在隐式策略优化阶段,利用内化的经验进行奖励驱动的强化学习,探索新的解决策略。
关键创新:SPEE的核心创新在于引入了经验蒸馏的概念,作为连接显式经验提取与隐式策略优化的桥梁。这一机制使得模型能够在经验积累的基础上进行有效的策略优化,克服了现有方法的局限。
关键设计:在SPEE中,设计了一个持续演化的全局经验池,用于整合成功与失败的轨迹知识,并过滤低效经验。此外,特权引导的在线自蒸馏(OPSD)机制被引入,以确保经验的有效内化。
🖼️ 关键图片
📊 实验亮点
在五个数学推理基准上,SPEE在不同模型规模下均表现优异,超越了测试时和训练时的自我演化基线,显示出显著的性能提升,具体提升幅度达到XX%。
🎯 应用场景
该研究的潜在应用领域包括自然语言处理、智能对话系统和自动化推理等。通过提升语言模型的自我改进能力,SPEE框架能够在多种任务中实现更高的准确性和效率,具有重要的实际价值和未来影响。
📄 摘要(原文)
Large language models (LLMs) capable of self-improvement require not only effective policy optimization, but also a principled mechanism for transforming transient interaction experience into persistent model capabilities. Existing self-improvement paradigms remain fragmented: test-time methods can explicitly extract experience but cannot internalize it into model parameters, whereas training-time optimization methods can update model parameters but lack an explicit mechanism for accumulating transferable experience. Bridging these two paradigms requires a critical intermediate stage that remains underexplored, namely \emph{experience distillation}. To address this gap, we propose \textbf{SPEE} (\textbf{S}elf-\textbf{P}rogressive \textbf{E}xperience \textbf{E}volution), a unified post-training framework that sequentially performs explicit experience evolution followed by implicit policy optimization. During explicit experience evolution, SPEE reflects on trajectories collected from multiple interactions to extract, verify, and progressively evolve transferable experience, which is subsequently internalized into the policy through privilege-guided On-Policy Self-Distillation (OPSD). During implicit policy optimization, reward-driven reinforcement learning leverages these internalized priors to explore novel solution strategies. In the experience evolution stage, a continuously evolving global experience pool consolidates knowledge from both successful and failed trajectories, filters out low-utility experience, and mitigates post-hoc rationalization induced by individual trajectories. Experiments on five mathematical reasoning benchmarks demonstrate that SPEE consistently outperforms both test-time and training-time self-evolution baselines across three model scales. The source code is available at https://github.com/rrrsj/SPEE.