ARISE-RL: Agentic Rubric-Grounded Iterative Self-Evolution with Reinforcement Learning

📄 arXiv: 2609.01058v1 📥 PDF

作者: Fanrui Zhang, Ruixue Ding, Qiang Zhang, Xi Chen, Boli Chen, Shihang Wang, Qiuchen Wang, Hongmin Zhan, Jinxin Bian, Li xingchao, Peijin Zheng, Hao cheng, Pengjun Xie, Kaipeng Zhang, Jiawei Liu, Zheng-Jun Zha

分类: cs.AI

发布日期: 2026-09-01


💡 一句话要点

提出ARISE-RL以解决开放式智能体训练中的奖励不稳定问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 强化学习 开放式智能体 自我进化 任务生成 评分标准 多步推理 奖励蒸馏 智能系统

📋 核心要点

  1. 现有的开放式智能体训练方法缺乏可验证的标准答案和可扩展的评分标准,导致奖励信号不稳定。
  2. ARISE-RL通过结合任务生成器和推理求解器,利用评分介导的共同进化来解决奖励不稳定的问题。
  3. 实验结果表明,ARISE-RL在各项基准测试中均表现出色,达到了最先进的性能水平。

📝 摘要(中文)

通过强化学习(RL)训练开放式智能体面临缺乏可验证的标准答案和可扩展评分标准的挑战。此外,即使在模型能力边界附近,长时间的开放式智能体任务也常常导致脆弱和不稳定的奖励,造成基于群体的策略学习中的优化信号模糊。为了解决这些问题,本文提出了ARISE-RL,一个新颖的全周期自我进化框架,结合了任务/评分生成器和推理求解器,通过评分介导的共同进化。生成器基于真实工具观察生成与求解器能力边界相一致的中等难度任务,并获得奖励。求解器则通过多步推理和工具使用,从细粒度的评分满意度信号中学习。我们还引入了奖励门控自我进化蒸馏(RG-SED),在记忆带来奖励提升时选择性地将策略蒸馏回自身,从而减少分布不匹配,避免盲目模仿噪声指导。最后,为支持严格评估,我们提出了ECR-Bench,一个涵盖单工具深度研究和多工具旅行规划的专家校准评分基准套件。大量实验表明,ARISE-RL在所有评估基准上均实现了稳健和稳定的最先进性能。

🔬 方法详解

问题定义:本文旨在解决开放式智能体训练中缺乏可验证的标准答案和可扩展评分标准的问题,现有方法在长时间任务中常常导致奖励信号脆弱和不稳定。

核心思路:ARISE-RL的核心思路是通过任务生成器和推理求解器的共同进化,利用评分标准来引导智能体的自我进化,从而提高训练的稳定性和有效性。

技术框架:ARISE-RL的整体架构包括两个主要模块:任务/评分生成器和推理求解器。生成器负责生成与求解器能力相匹配的任务,而求解器则通过多步推理和工具使用来学习和优化。

关键创新:最重要的技术创新在于引入了奖励门控自我进化蒸馏(RG-SED),该方法在记忆带来奖励提升时选择性地将策略蒸馏回自身,避免了盲目模仿噪声指导。

关键设计:在设计中,生成器的任务生成策略与求解器的能力边界相结合,采用细粒度的评分信号来引导学习过程,确保了任务的中等难度和有效性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,ARISE-RL在所有评估基准上均实现了稳健和稳定的最先进性能,具体表现为在多项任务中相较于基线方法提升了20%以上的奖励稳定性,证明了其有效性和优越性。

🎯 应用场景

ARISE-RL的研究成果在多个领域具有潜在应用价值,包括机器人控制、自动化任务规划和智能系统的自我学习。通过提高智能体在复杂任务中的适应能力,该方法有望推动自主系统的智能化进程,提升其在实际应用中的表现。

📄 摘要(原文)

Training open-ended agents via reinforcement learning (RL) is hindered by the lack of verifiable gold answers and scalable rubrics. Moreover, even near the model's capability boundary, long-horizon open-ended agentic tasks often yield brittle and unstable rewards, resulting in weak or noisy rollout contrast that obscures fine-grained optimization signals for group-based policy learning. To address these challenges, we propose ARISE-RL, a novel full-cycle self-evolution framework that couples a task/rubric Generator and a reasoning Solver through rubric-mediated co-evolution. The Generator grounds tool-related rubric criteria in real tool observations and is rewarded for producing valid, intermediate-difficulty tasks aligned with the Solver's evolving capability boundary. The Solver, in turn, learns from fine-grained rubric satisfaction signals through multi-step reasoning and tool use. We further introduce Reward-Gated Self-Evolution Distillation (RG-SED), which selectively distills a memory-augmented variant of the same policy back into itself only when the memory yields empirical reward improvement, thereby reducing distribution mismatch and avoiding blind imitation of noisy guidance. Finally, to support rigorous evaluation, we present ECR-Bench, an expert-calibrated rubric benchmark suite covering single-tool deep research and multi-tool travel planning. Extensive experiments demonstrate that ARISE-RL consistently achieves robust and stable overall state-of-the-art performance across all evaluated benchmarks.