Not Every Divergence Should Be Suppressed: Counterfactual Recoverability in On-Policy Distillation
作者: De Jiang, Zhengyang Zhang, Kehong Yuan, Shaohua Ma
分类: cs.LG, cs.AI
发布日期: 2026-08-05
💡 一句话要点
提出反事实可恢复性方法以优化在线蒸馏训练
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 在线蒸馏训练 反事实可恢复性 强化学习 轨迹监督 机器人控制
📋 核心要点
- 现有的在线蒸馏训练方法无法有效判断错误前缀的可纠正性,导致训练效率低下。
- 本文提出反事实可恢复性作为决策变量,通过重放错误状态来优化轨迹监督策略。
- 实验表明,基于可恢复性的控制在多个基准测试中取得了显著的性能提升,尤其是在AIME2025数据集上。
📝 摘要(中文)
在线蒸馏训练(OPD)通过监督学生访问的轨迹进行学习,但现有的基于差异的规则无法判断错误前缀是否可纠正。本文将这一决策形式化为反事实可恢复性,并通过预算匹配的教师延续和回滚分支重放每个错误状态。根据相对成功率,将状态分类为可恢复、不可逆但可避免或模糊,并据此指导训练是否保留、回滚或常规监督相应轨迹。实验结果显示,基于可恢复性的控制在多个评估中表现出色,显著优于传统方法。
🔬 方法详解
问题定义:本文解决的问题是如何在在线蒸馏训练中判断错误前缀的可恢复性。现有方法依赖于差异度量,无法有效区分可纠正和不可纠正的错误状态。
核心思路:论文提出反事实可恢复性作为决策依据,通过教师延续和回滚分支重放错误状态,从而优化轨迹的监督策略。这样的设计旨在提高训练的有效性和准确性。
技术框架:整体框架包括三个主要模块:错误状态重放、状态分类和监督策略调整。首先重放错误状态,然后根据相对成功率对状态进行分类,最后根据分类结果调整监督策略。
关键创新:最重要的创新点在于引入反事实可恢复性作为决策变量,能够有效指导轨迹的选择性监督。这与传统的基于差异的监督方法有本质区别。
关键设计:在实验中,采用了预算匹配的教师延续和回滚策略,设计了相应的损失函数以优化可恢复性代理,并通过组件消融实验验证了保留教师可纠正前缀的有效性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,基于可恢复性的控制在AIME2025数据集上取得了0.578的成功率,相较于最佳基线的0.517有显著提升。此外,AIME2024-2025的平均性能从0.2656提升至0.3125,GPQA-Diamond的平均性能从0.2702提升至0.3070,展示了方法的有效性。
🎯 应用场景
该研究的潜在应用领域包括强化学习、机器人控制和自动驾驶等。通过优化在线蒸馏训练,可以提高智能体在复杂环境中的学习效率和决策能力,具有重要的实际价值和未来影响。
📄 摘要(原文)
On-policy distillation (OPD) supervises student-visited trajectories, yet divergence-based rules cannot determine whether an erroneous prefix remains correctable. We formulate this decision as counterfactual recoverability and replay each error state through budget-matched teacher-continuation and rollback branches. Based on their relative success, states are categorized as recoverable, irreversible-but-avoidable, or ambiguous, and these labels guide whether training retains, rolls back, or conventionally supervises the corresponding trajectory. On AIME branch diagnostics, the mean continuation-minus-rollback effect is 0.185 for recoverable states and -1.000 for irreversible-but-avoidable states, demonstrating opposite intervention preferences. A branch-derived recoverability proxy achieves an AUC of 1.000, substantially outperforming divergence alone at 0.392. Across frozen evaluations, recoverability-aware control achieves the strongest recorded performance, reaching 0.578 success on held-out AIME2025 compared with 0.517 for the best baseline. It also improves AIME2024-2025 average@32 from 0.2656 to 0.3125 and GPQA-Diamond average@32 from 0.2702 to 0.3070. Component ablations further show that retaining teacher-correctable prefixes provides the largest individual contribution. These findings establish recoverability as an outcome-grounded decision variable for selective supervision in OPD.