RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning
作者: Jinkun Hou, Zhuo Liu, Huimin Ren, Hongsheng Xin, Pan Zhou, Kun Zhan
分类: cs.AI
发布日期: 2026-08-10
💡 一句话要点
提出RISE-RL以解决开放式强化学习中的多维标准对齐问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 开放式强化学习 多维标准对齐 奖励过滤 选择性探索 大型语言模型
📋 核心要点
- 现有的基于标准的强化学习方法在处理多维反馈时存在能力差距难以针对的问题。
- RISE-RL通过选择性探索和奖励过滤,聚焦于未满足的标准,从而引导模型发现更优的生成轨迹。
- 实验结果显示,RISE-RL在多个基准测试中均取得了显著的平均分提升,尤其在创意写作任务上提升达6.0分。
📝 摘要(中文)
对大型语言模型(LLMs)进行开放式任务对齐具有挑战性,因为响应必须满足多维标准,而不是遵循单一正确的生成轨迹。现有的基于标准的强化学习方法将细粒度的标准反馈压缩为标量奖励,使得在有限的策略探索下难以针对持续的能力差距。我们提出了RISE-RL(Rubric-Informed Selective Exploration),通过利用反复未满足的标准来引导难以通过无指导探索发现的特权轨迹。RISE-RL仅保留那些完整标准奖励超过自然回合均值的轨迹,并在原始提示下重新评估,以强调自然策略支持较弱的行为。实验表明,RISE-RL在多个基准测试中表现优异,尤其在创意写作任务上取得显著提升。
🔬 方法详解
问题定义:论文要解决的问题是如何有效对齐大型语言模型在开放式任务中的多维标准反馈。现有方法通过压缩反馈为标量奖励,导致在有限的策略探索下难以识别和改善模型的能力差距。
核心思路:RISE-RL的核心思路是利用反复未满足的标准来引导模型探索特权轨迹,这些轨迹在无指导探索中难以发现。通过保留高于自然回合均值的轨迹并重新评估,强调模型在某些行为上的不足。
技术框架:RISE-RL的整体架构包括选择性探索模块、奖励过滤模块和再评估模块。首先,通过分析未满足的标准,选择出特定的轨迹;然后,计算这些轨迹的完整标准奖励,并与自然回合的均值进行比较;最后,针对表现较弱的行为进行再评估。
关键创新:RISE-RL的创新点在于通过选择性内部化和奖励过滤来优化探索过程,与传统的基于标准的强化学习方法相比,能够更有效地引导模型发现优质轨迹。
关键设计:在设计上,RISE-RL采用了动态奖励过滤机制,确保只保留那些表现优异的轨迹。同时,使用了辅助目标来优化指导信号,并在其效益减弱时移除该信号。具体的损失函数和参数设置在实验中经过调优,以确保最佳性能。
🖼️ 关键图片
📊 实验亮点
RISE-RL在多个基准测试中表现优异,尤其在4B和14B模型上分别提升了1.3分和3.3分。在创意写作任务CreativeWriting-V3上,RISE-RL更是实现了6.0分的显著提升,显示出其在提高生成质量和多样性方面的有效性。
🎯 应用场景
RISE-RL的研究成果在多个领域具有潜在应用价值,尤其是在需要开放式生成的任务中,如创意写作、对话系统、医疗文本生成等。通过有效对齐多维标准,RISE-RL能够提升模型的生成质量和多样性,未来可能在教育、医疗和娱乐等行业产生深远影响。
📄 摘要(原文)
Aligning Large Language Models (LLMs) for open-ended tasks is challenging because responses must satisfy multidimensional criteria without following a single correct generation trajectory. Existing rubric-based reinforcement learning (RL) methods compress fine-grained criterion-level feedback into scalar rewards, making persistent capability gaps difficult to target under limited on-policy exploration. We propose $\textbf{RISE-RL}$ (Rubric-Informed Selective Exploration), which uses repeatedly missed rubric criteria to elicit privileged trajectories that are difficult to discover through unguided exploration alone. RISE-RL retains only trajectories whose complete-rubric reward exceeds the mean reward of natural rollouts, and then re-evaluates them under the original prompt to emphasize behaviors that remain weakly supported by the natural policy. The resulting guidance signal is optimized through a separate auxiliary objective and removed once its additional benefit diminishes. Experiments with 4B and 14B models across writing, chat, health, and science show that RISE-RL achieves the highest mean score on every evaluated benchmark under guidance-free evaluation. Compared with standard Rubric-RL, it improves the average score by 1.3 points at the 4B scale and $\textbf{3.3 points at the 14B scale}$, including a $\textbf{6.0-point}$ gain on CreativeWriting-V3. It also improves creative-writing diversity and yields gains on objectively scored medical and scientific benchmarks. These results indicate that selective internalization through reward filtering and policy support shaping is effective for open-ended reinforcement learning.