Is Next-Chunk Reasoning RL Really Better than SFT? Revisiting Training Strategies under no-CoT Data

📄 arXiv: 2608.23256v1 📥 PDF

作者: Yinhao Tang, Youqing Fang, Yanan Sun, Jiangning Liu, Ziyi Wang, Xun Zhao, Weiming Zhang, Bin Liu, Kuikun Liu, Wenwei Zhang, Kai Chen

分类: cs.AI

发布日期: 2026-08-24


💡 一句话要点

提出混合SFT以超越下一块推理强化学习的性能

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 无链思维数据 强化学习 监督微调 数学推理 模型训练 性能评估 推理能力

📋 核心要点

  1. 现有的下一块推理RL方法在与传统SFT的比较中未能明确收益来源,存在评估不足的问题。
  2. 论文提出混合SFT方法,通过联合训练无CoT和长CoT数据,提供了一种简单有效的替代方案。
  3. 实验结果显示,混合SFT在后RLVR性能上显著优于下一块推理RL,且计算资源需求大幅降低。

📝 摘要(中文)

近期研究提出了下一块推理强化学习(next-chunk reasoning RL)方法,旨在利用缺乏链式思维(CoT)标注的数据,如工作解决方案和教科书推导。这种方法训练模型生成隐式推理轨迹,并通过预测文本下一块的能力进行奖励。然而,现有评估主要与传统的监督微调(SFT)基线进行比较,尚未明确收益是否源于RL框架本身或更有效地利用了无CoT数据。本文通过对下一块推理RL和一种简单但被忽视的替代方案——混合SFT的对比研究,发现混合SFT在后RLVR性能上明显优于下一块推理RL,同时训练计算需求减少超过60倍。该优势在领域内外的数学推理任务中均表现一致。

🔬 方法详解

问题定义:论文旨在解决下一块推理RL方法在无CoT数据利用上的不足,特别是现有方法未能明确其性能提升的来源。

核心思路:提出混合SFT方法,通过在单一监督微调阶段同时训练无CoT和长CoT数据,以提高模型的推理能力和性能。

技术框架:整体架构包括数据预处理、模型训练和评估三个主要阶段。数据预处理阶段将无CoT和长CoT数据整合,模型训练阶段采用混合SFT策略,最后通过标准化评估指标进行性能评估。

关键创新:混合SFT作为一种简单有效的训练策略,显著提高了模型的后RLVR性能,并且在计算资源上更为高效,与传统的下一块推理RL方法形成鲜明对比。

关键设计:在训练过程中,混合SFT使用了特定的损失函数来平衡无CoT和长CoT数据的影响,同时优化了模型的参数设置,以确保在不同类型数据上的有效学习。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,混合SFT在后RLVR性能上明显优于下一块推理RL,且训练计算需求减少超过60倍。这一优势在领域内外的数学推理任务中均得到了验证,显示出混合SFT的有效性和广泛适用性。

🎯 应用场景

该研究的潜在应用领域包括教育技术、自动化推理系统和智能问答系统。通过提高模型在无CoT数据上的推理能力,能够更好地支持复杂问题的解决,提升学习和教学效果,具有重要的实际价值和未来影响。

📄 摘要(原文)

Recent work proposes next-chunk reasoning RL for leveraging no-CoT data---corpora such as worked solutions and textbook derivations that contain reasoning-rich content but lack explicit chain-of-thought annotations. The method trains a model to generate implicit reasoning traces and rewards them by their ability to predict the next chunk of text. While promising, existing evaluations primarily compare against conventional SFT baselines, leaving open whether the gains come from the RL formulation itself or from more effectively exposing the model to no-CoT data. We address this question with a controlled study of next-chunk reasoning RL and a simple but previously overlooked alternative: Mixed SFT, a single supervised fine-tuning stage that jointly trains on no-CoT and long-CoT data. Despite its simplicity, Mixed SFT achieves a clearly higher post-RLVR performance ceiling than next-chunk reasoning RL while requiring over 60 times less training compute. The advantage is consistent across in-domain mathematical reasoning and out-of-domain reasoning tasks. Moreover, we show that higher pre-RLVR accuracy does not necessarily translate into higher post-RLVR accuracy, highlighting the need to evaluate no-CoT training strategies in the context of the full post-training pipeline.