TurboT2VA: Fast Large-Scale Text-to-Video-Audio Generation via Score-Regularized Consistency Distillation

📄 arXiv: 2608.24674v1 📥 PDF

作者: Xiaoda Yang, Yuxiang Liu, Kaiwen Zheng, Yuan Liu, Yibo Lai, Shengpeng Ji, Kai Jiang, Jianfei Chen, Xiaobin Hu, Shuicheng Yan, Jintao Zhang, Jun Zhu, Zhou Zhao

分类: cs.CV

发布日期: 2026-08-25

🔗 代码/项目: GITHUB


💡 一句话要点

提出TurboT2VA以解决大规模文本到视频音频生成的效率问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 文本到视频生成 音频生成 蒸馏训练 多模态生成 高效推理

📋 核心要点

  1. 现有的文本到视频音频生成方法在推理时面临高延迟和计算资源消耗的问题,尤其是在大规模模型中。
  2. TurboT2VA通过引入每种模态的归一化和渐进式课程设计,逐步优化生成过程,解决了模态不平衡和一致性训练的挑战。
  3. 在LTX-2数据集上,TurboT2VA显著提高了生成速度,延迟从50.52秒降至2.51秒,速度提升达到20.1倍,同时保持了生成质量。

📝 摘要(中文)

联合文本到视频音频生成能够产生同步的视觉和声学内容,但大模型的长采样轨迹和异构多模态计算使得推理成本高昂。本文提出TurboT2VA,一个用于加速19B参数联合视频音频模型的蒸馏和推理框架。TurboT2VA通过每种模态的归一化和渐进式课程设计解决了模态不平衡优化、连续时间一致性训练的难度以及质量与多样性之间的权衡。实验结果表明,在LTX-2数据集上,四步蒸馏将生成器延迟从50.52秒降低到2.51秒,实现了20.1倍的加速,同时保持了强大的视觉质量、音频保真度、多样性和视频音频同步性。

🔬 方法详解

问题定义:本文旨在解决大规模文本到视频音频生成中的高延迟和计算资源消耗问题。现有方法在处理多模态生成时,面临模态不平衡和一致性训练的挑战,导致推理效率低下。

核心思路:TurboT2VA的核心思路是通过每种模态的归一化和渐进式课程设计,逐步优化生成过程,先建立稳定的生成轨迹,再进行分布级别的优化,从而提高生成效率和质量。

技术框架:TurboT2VA的整体架构包括多个阶段:首先进行离散一致性预热,然后进行连续一致性精炼,最后进行联合一致性-分布匹配。每个阶段都针对特定的优化目标,确保生成过程的稳定性和多样性。

关键创新:TurboT2VA的主要创新在于其渐进式课程设计和模态归一化策略,这与传统的直接优化方法有本质区别,能够有效解决模态不平衡和一致性训练的问题。

关键设计:在设计中,TurboT2VA采用了守护的W8A8和融合操作符、填充文本压缩以及模态感知稀疏注意力等技术,确保在高分辨率下仍能保持密集的跨模态和文本条件路径。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,TurboT2VA在LTX-2数据集上,通过四步蒸馏将生成器延迟从50.52秒降低至2.51秒,实现了20.1倍的速度提升。同时,在高分辨率设置下,延迟从318.74秒降至5.83秒,速度提升达到54.67倍,且生成质量保持优异。

🎯 应用场景

TurboT2VA在多模态生成领域具有广泛的应用潜力,尤其是在影视制作、游戏开发和虚拟现实等场景中。其高效的生成能力能够帮助创作者快速生成高质量的视觉和音频内容,提升创作效率和用户体验。未来,该技术还可能推动更复杂的多模态交互应用的发展。

📄 摘要(原文)

Joint text-to-video-audio generation produces synchronized visual and acoustic content, but the long sampling trajectories and heterogeneous multimodal computation of large models make inference prohibitively expensive. We present TurboT2VA, a distillation and inference framework for accelerating a 19B-parameter joint video-audio model. Large-scale T2VA distillation is challenged by modality-imbalanced optimization, the difficulty of continuous-time consistency training at scale, and the quality--diversity trade-off. TurboT2VA addresses these issues with per-modality normalization and a progressive curriculum comprising discrete consistency warm-up, continuous consistency refinement, and joint consistency--distribution matching. The curriculum first establishes a stable, diverse generation trajectory and only then introduces distribution-level refinement. On LTX-2, four-step distillation reduces generator latency from 50.52s to 2.51s at the standard evaluation resolution of 512$\times$768, achieving a 20.1$\times$ speedup while maintaining strong visual quality, audio fidelity, diversity, and video-audio synchronization. We further develop an architecture-aware inference stack that combines guarded W8A8 and fused operators, padded-text compaction, and modality-aware sparse attention while preserving dense cross-modal and text-conditioning paths. Under the high-resolution deployment setting at 1024$\times$1792, the complete stack reduces generator latency from 318.74s to 5.83s on one NVIDIA H20, achieving a 54.67$\times$ generator-only speedup. Inference code and generation demos are available at https://github.com/thu-ml/TurboDiffusion/tree/main/turbot2va.