From Rollouts to Recipes: Self-Contained Post-Training for LLMs

📄 arXiv: 2609.01422v1 📥 PDF

作者: Yifei Li, Lingling Zhang, Muye Huang, Zihan Ma, Jiashuai Liu, Jun Liu

分类: cs.CL

发布日期: 2026-09-01

备注: 14 pages, 5 figures. Accepted at EMNLP 2026


💡 一句话要点

提出自适应后训练框架以优化大语言模型的样本处理

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 后训练 样本优化 动态路由 大语言模型 自适应学习

📋 核心要点

  1. 现有的后训练方法对所有样本采用统一的训练方案,未能充分利用模型的回滚信息,导致学习效率低下。
  2. 本文提出的Self-Routing框架根据样本的行为状态动态选择优化策略,从而实现更高效的后训练过程。
  3. 实验结果显示,Self-Routing在多个基线模型上均显著提升了数学推理任务的性能,验证了其有效性。

📝 摘要(中文)

后训练的大语言模型通常对所有样本应用单一的训练方案,尽管模型自身的回滚显示不同样本的学习状态。本文提出了一种行为条件的后训练框架Self-Routing,利用回滚的正确性和置信度来决定每个样本的优化方式。根据行为状态,样本被路由到GRPO、在线自蒸馏、正则化或跳过,从而实现无需外部教师、额外注释或额外采样的自适应训练。在Qwen3和Qwen3.5骨干网络上的数学推理实验表明,Self-Routing在均匀GRPO、均匀OPSD、固定混合和更简单的路由基线之上始终表现出改进。进一步分析显示,路由分布在训练过程中发生变化,并减少了对低信号或已稳定样本的不必要更新。

🔬 方法详解

问题定义:本文旨在解决后训练过程中样本处理的单一性问题,现有方法未能根据样本的具体学习状态进行优化,导致训练效率低下。

核心思路:提出Self-Routing框架,通过回滚的正确性和置信度来动态路由样本,选择最合适的优化策略,以实现自适应训练。

技术框架:该框架包括样本行为状态的评估模块、路由决策模块和不同优化策略的执行模块,能够根据实时反馈调整训练过程。

关键创新:最重要的创新在于引入了行为条件的样本路由机制,使得训练过程能够根据样本的具体情况进行灵活调整,区别于传统的统一训练方法。

关键设计:在设计中,采用了多种优化策略,包括GRPO、在线自蒸馏和正则化等,并通过动态路由机制来选择最优策略,确保训练过程的高效性和针对性。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果表明,Self-Routing在数学推理任务中相较于均匀GRPO和均匀OPSD等基线模型,性能提升显著,具体提升幅度达到X%(具体数据未知),验证了该方法的有效性和优越性。

🎯 应用场景

该研究的潜在应用领域包括自然语言处理、对话系统和智能问答等。通过优化大语言模型的后训练过程,能够提高模型在特定任务上的表现,进而提升用户体验和系统的智能化水平。未来,该框架有望推广到更多的机器学习任务中,推动智能系统的进一步发展。

📄 摘要(原文)

Post-training large language models usually applies a single training recipe to all samples, even though the model's own rollouts reveal different sample-level learning states. We propose Self-Routing, a behavior-conditioned post-training framework that uses rollout correctness and confidence to decide how each sample should be optimized. Depending on its behavior state, a sample is routed to GRPO, on-policy self-distillation, regularization, or skipping, allowing training to adapt without external teachers, extra annotations, or additional sampling. Experiments on mathematical reasoning across Qwen3 and Qwen3.5 backbones show that Self-Routing consistently improves over uniform GRPO, uniform OPSD, fixed mixtures, and simpler routing baselines. Further analyses show that the routing distribution changes over training and reduces unnecessary updates on low-signal or already stable samples.