TTPO: Test-Time Policy Optimization

📄 arXiv: 2608.27448v1 📥 PDF

作者: Aozhe Wang, Zhengxi Lu, Jianze Wang, Shangke Lv, Ying Liu, Weiming Lu, Jun Xiao, Yueting Zhuang, Hua Yang, Qianglong Chen, Yongliang Shen

分类: cs.CL

发布日期: 2026-08-27

备注: Project Page: https://zju-real.github.io/TTPO Code: https://github.com/ZJU-REAL/TTPO


💡 一句话要点

提出TTPO以解决测试时训练中的标签依赖问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 测试时训练 策略优化 伪标签 强化学习 自蒸馏 跨任务泛化

📋 核心要点

  1. 现有方法在测试时训练中依赖真实标签,限制了其灵活性和适用性。
  2. TTPO通过不对称目标优化,利用伪标签蒸馏一致的rollouts,并惩罚不一致的rollouts。
  3. 在多个基准测试中,TTPO在无标签情况下显著提升了模型性能,展示了强大的跨任务泛化能力。

📝 摘要(中文)

近年来,后训练方法如强化学习和在线自蒸馏推动了大型语言模型在数学推理方面的快速进展,但其对真实标签的依赖限制了测试时训练的应用。本文提出了一种替代方案,使用多数投票伪标签,但这一方法存在脆弱性。我们观察到,错误的投票会导致教师模型的误导,进而影响所有token。基于此观察,我们提出了测试时策略优化(TTPO),通过不对称目标来蒸馏一致的rollouts,并利用分组强化学习惩罚不一致的rollouts。实验结果表明,TTPO在五个竞争级基准上与标签监督的在线自蒸馏相匹配,显著提升了模型性能。

🔬 方法详解

问题定义:论文要解决的问题是现有后训练方法在测试时训练中对真实标签的依赖性,这限制了其在实际应用中的灵活性和有效性。现有方法在使用伪标签时容易受到错误投票的影响,导致模型性能下降。

核心思路:TTPO的核心思路是通过不对称目标优化来蒸馏一致的rollouts,并利用分组强化学习来惩罚不一致的rollouts。这种设计旨在减少伪标签错误对模型的负面影响,同时提高模型在无标签情况下的学习能力。

技术框架:TTPO的整体架构包括两个主要模块:一是通过在线自蒸馏来提取一致的rollouts,二是通过分组强化学习来惩罚不一致的rollouts。此外,token级选择进一步优化了两个分支的学习过程。

关键创新:TTPO的最重要创新在于其不对称目标的设计,能够有效区分一致和不一致的rollouts,从而在伪标签频繁错误的情况下仍然保持良好的学习效果。这与现有方法依赖于真实标签的方式有本质区别。

关键设计:在关键设计上,TTPO采用了分组强化学习来专注于惩罚自信错误,并通过蒸馏降低已收敛位置的权重。此外,损失函数的设计也考虑了伪标签的频繁错误,确保了模型在训练过程中的稳定性。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

TTPO在五个竞争级基准上表现出色,能够在无标签情况下与标签监督的在线自蒸馏方法相匹配。具体而言,Qwen3-1.7B模型在测试时训练中的性能从38.0%提升至45.2%,并在无思考情况下实现了+25.2%至+36.4%的提升,展示了强大的跨任务泛化能力。

🎯 应用场景

TTPO的研究成果在多个领域具有广泛的应用潜力,尤其是在需要快速适应新环境或任务的场景中,如自动驾驶、机器人控制和在线学习等。其无标签学习的能力使得模型在数据稀缺的情况下仍能有效提升性能,具有重要的实际价值和未来影响。

📄 摘要(原文)

Recent prominent post-training methods, such as Reinforcement Learning (RL) and On-Policy Self-Distillation (OPSD), have driven rapid progress in mathematical reasoning for large language models, yet their reliance on ground-truth labels precludes test-time training (TTT). Replacing ground truth with majority-vote pseudo-labels is a natural alternative, yet it is fragile: an incorrect vote corrupts the teacher and misleads every token. We observe that this failure mode is asymmetric: rollouts that disagree with the pseudo-label are typically wrong regardless of whether the vote itself is correct. Building on this observation, we propose Test-Time Policy Optimization (TTPO), an asymmetric objective that distills agreeing rollouts via OPSD and penalizes disagreeing rollouts with Grouped RL. Token-level selection further refines both branches: distillation down-weights already-converged positions, while RL penalizes only confident errors. Both updates remain well-grounded even under frequent pseudo-label errors, and majority-vote routing yields tighter self-supervision as the model improves. Without any labels, TTPO matches label-supervised OPSD on five competition-level benchmarks, raises Qwen3-1.7B from 38.0% to 45.2% in TTT, yields +25.2% to +36.4% without thinking, and shows strong cross-task generalization.