GROW: Group-Relative Advantage-Weighted On-Policy Reinforcement Learning of Autoregressive-Diffusion Text-to-Speech model
作者: Guanrou Yang, Tian Tan, Qian Chen, Ziyang Ma, Yakun Song, Zhikang Niu, Qi Chen, Wenming Tu, Haitao Li, Shan Yang, Xie Chen
分类: eess.AS, cs.AI, cs.CL
发布日期: 2026-08-04
💡 一句话要点
提出GROW方法以解决流匹配文本到语音的强化学习挑战
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 文本到语音 强化学习 流匹配 模型优化 语音合成 奖励加权 Wasserstein惩罚
📋 核心要点
- 现有的轨迹级策略梯度方法在流匹配文本到语音任务中面临复杂的确定性ODE采样问题,导致效率低下。
- GROW方法通过直接在标准流匹配目标上进行操作,利用组相对优势加权来优化奖励结构,简化了学习过程。
- 实验表明,GROW在WER和说话者相似性上均有显著提升,且训练速度比现有方法快2.9倍。
📝 摘要(中文)
流匹配文本到语音的强化学习因确定性ODE采样而复杂,现有的轨迹级策略梯度方法通常将ODE转化为SDE,并跟踪每一步的似然比,导致引入随机扰动和显著的开销。本文提出GROW,一种基于组相对优势加权的在线强化学习方法,直接作用于标准流匹配目标。GROW为每个提示样本生成一组在线话语,分别标准化组内的可懂性和说话者相似性奖励,并将其结合以重新加权流匹配回归。通过Wasserstein-2速度惩罚将更新后的模型锚定到冻结的预训练参考模型。引入组均值奖励基线将奖励加权转换为优势加权。实验结果表明,GROW在LibriSpeech和Seed-TTS EN/ZH上显著提升了性能。
🔬 方法详解
问题定义:本文旨在解决流匹配文本到语音中的强化学习效率低下问题,现有方法因确定性ODE采样而引入随机扰动和显著开销。
核心思路:GROW方法通过直接在标准流匹配目标上进行操作,采用组相对优势加权,优化了奖励结构,避免了复杂的ODE转SDE过程。
技术框架:GROW的整体架构包括样本生成、奖励标准化、流匹配回归加权和模型更新四个主要模块。每个模块协同工作以提升学习效率和模型性能。
关键创新:GROW的核心创新在于引入组均值奖励基线,将奖励加权转换为优势加权,从而实现更有效的组内信用分配,区别于传统的奖励加权方法。
关键设计:GROW采用Wasserstein-2速度惩罚作为关键设计,确保更新后的模型与冻结的预训练参考模型保持一致,同时在奖励标准化和加权过程中,采用了正指数加权和零均值签名优势的策略。
🖼️ 关键图片
📊 实验亮点
GROW在LibriSpeech和Seed-TTS EN/ZH数据集上将平均字错误率(WER)从2.016降低至1.558,同时说话者相似性从0.676提升至0.715,且在10-NFE训练回合下,训练速度比32-NFE DiTAR-GRPO快2.9倍,展示了显著的性能提升。
🎯 应用场景
该研究的潜在应用领域包括语音合成、智能助手和人机交互等,能够显著提升文本到语音系统的自然度和相似性,未来可能推动语音技术在多种场景中的广泛应用。
📄 摘要(原文)
Reinforcement learning for flow-matching text-to-speech is complicated by deterministic ODE sampling: trajectory-level policy-gradient methods typically convert the ODE into an SDE and track per-step likelihood ratios, introducing stochastic perturbations and substantial overhead. We propose GROW, a group-relative advantage-weighted on-policy RL method that acts directly on the standard flow-matching objective. For each prompt, GROW samples a group of on-policy utterances, separately standardizes intelligibility and speaker-similarity rewards within the group, and combines them to reweight flow-matching regression. A Wasserstein-2 velocity penalty anchors the updated model to a frozen pretrained reference. A group-mean reward baseline is introduced to convert reward weighting into advantage weighting. For strong pretrained TTS models with concentrated rewards, positive exponential weighting is dominated by reward-agnostic self-imitation, whereas a zero-mean signed advantage preserves effective within-group credit assignment. Instantiated on DiTAR and evaluated on LibriSpeech and Seed-TTS EN/ZH, GROW reduces average WER from 2.016 to 1.558 and raises speaker similarity from 0.676 to 0.715 while keeping UTMOS. With 10-NFE training rollouts and 32-NFE evaluation, GROW retains comparable performance while training 2.9x faster than 32-NFE DiTAR-GRPO. We will open-source complete GROW codes, faithful DiTAR reproduction, and all model checkpoints.