SRPO: Self-Reflective Policy Optimization for Long-Horizon Reasoning

📄 arXiv: 2608.23493v1 📥 PDF

作者: Jialong Liu, Yuling Shi, Ning Yang, Xiaodong Gu, Zuchao Li

分类: cs.AI

发布日期: 2026-08-24

备注: Accepted to ICML 2026

🔗 代码/项目: GITHUB


💡 一句话要点

提出自反政策优化框架以提升长时间推理能力

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 自反机制 政策优化 长时间推理 大型语言模型 数据效率 机器学习 智能系统

📋 核心要点

  1. 现有方法在长时间推理任务中面临稀疏反馈的问题,导致学习效率低下。
  2. SRPO框架通过自我反思机制,将稀疏反馈转化为密集的训练信号,提升学习效果。
  3. SRPO在多个基准测试中表现优异,使用较少的计算资源实现了显著的性能提升。

📝 摘要(中文)

自反机制在人类学习中是一种强大的信用分配工具,将稀疏的结果反馈转化为可操作的指导。然而,这种机制在后训练的大型语言模型(LLMs)中的潜力尚未得到充分探索。我们提出了自反政策优化(SRPO)框架,使LLMs能够分析自身完成的轨迹,将错误合成简洁的“反思补丁”,并利用反思条件的教师评分作为密集的标记级训练信号。这一过程有效地将稀疏的终端监督转化为密集的标记级学习信号,无需外部评论者、单独的奖励模型或更大的教师模型。实验表明,SRPO在数学推理和长时间代理基准测试中实现了最先进的性能,数据效率极高。

🔬 方法详解

问题定义:本论文旨在解决长时间推理任务中稀疏反馈导致的学习效率低下问题。现有方法通常依赖于外部奖励模型或评论者,限制了其灵活性和效率。

核心思路:SRPO通过自我反思机制,使模型能够分析自身的输出轨迹,并将错误信息转化为可用于训练的“反思补丁”。这种设计旨在增强模型的自我学习能力,减少对外部监督的依赖。

技术框架:SRPO的整体架构包括轨迹分析模块、反思补丁生成模块和基于反思的教师评分模块。模型首先分析其生成的轨迹,识别错误并生成反思补丁,然后利用这些补丁进行密集的标记级训练。

关键创新:SRPO的主要创新在于将自我反思机制内化为训练过程的一部分,显著提高了模型在长时间推理任务中的表现。这一方法与传统的依赖外部反馈的策略有本质区别。

关键设计:在实现中,SRPO采用了特定的损失函数来优化反思补丁的生成,并设计了高效的网络结构以支持快速的反馈分析和学习。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

SRPO在多个基准测试中表现出色,使用Qwen3-8B基础模型,在AIME'24上达到了73.3%的成绩,仅使用了8%的训练FLOPs,相较于传统的监督微调方法,成功率在WebShop、ALFWorld和SWE-Bench-Lite上分别提高了64.7%、76.8%和31.2%。

🎯 应用场景

SRPO框架具有广泛的应用潜力,特别是在需要长时间推理的任务中,如自动驾驶、机器人控制和复杂决策系统。通过提升模型的自我学习能力,SRPO能够在实际应用中显著提高效率和准确性,推动智能系统的发展。

📄 摘要(原文)

Self-reflection is a powerful mechanism for credit assignment in human learning, converting sparse outcome feedback into actionable guidance. However, its potential for post-training Large Language Models (LLMs) remains underexplored. We propose Self-Reflective Policy Optimization (SRPO), a framework that internalizes this capability. SRPO enables LLMs to analyze their own completed trajectories, synthesize errors into concise "reflection patches," and use reflection-conditioned teacher scores on student on-policy rollouts as dense token-level training signals. This process effectively transforms sparse terminal supervision into dense, token-level learning signals without requiring external critics, separate reward models, or larger teacher models. We demonstrate that SRPO achieves state-of-the-art performance across mathematical reasoning and long-horizon agentic benchmarks with exceptional data efficiency. Using a Qwen3-8B base model, SRPO attains 73.3% on AIME'24 using only 8% (0.08x) of the training FLOPs required by scaled supervised fine-tuning, while significantly improving success rates on WebShop (64.7%), ALFWorld (76.8%), and SWE-Bench-Lite (31.2%). Code is available at https://github.com/Galleons2029/SRPO