MLLM-Guided Semantic Correction for Text-to-Video Generation

📄 arXiv: 2608.16513v1 📥 PDF

作者: Junhao Chen, Zheqi Lv, Keting Yin, Shengyu Zhang, Zhou Zhao, Feiyang Chen, Xinyu Duan, Baoxing Huai, Fei Wu

分类: cs.CV, cs.AI

发布日期: 2026-08-17


💡 一句话要点

提出MLLM引导的语义修正方法以解决文本到视频生成中的语义错误问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 文本到视频生成 语义修正 多模态大语言模型 扩散模型 视觉保真度 时间一致性 深度学习

📋 核心要点

  1. 现有文本到视频生成模型常出现语义错误,导致生成内容与输入文本不一致,影响生成质量。
  2. 本文提出了一种中间生成修正框架,利用多模态大语言模型的反馈,在视频合成过程中实时修正语义偏差。
  3. 实验结果表明,所提方法在多个基准测试中显著提高了生成视频的语义一致性和视觉质量。

📝 摘要(中文)

近年来,扩散模型和Transformer架构的进步使文本到视频生成取得显著进展。然而,这些模型常常面临语义错误,如缺失对象、属性不正确或动作不匹配。虽然一些语义修正方法在采样前进行优化或在采样后进行精炼,但在视频生成过程中如何检测和修正语义偏差仍然未被充分探索。本文提出了一种无训练、可解释的中间生成修正框架,将多模态大语言模型(MLLM)反馈直接集成到扩散采样循环中。通过在视频合成过程中注入语义评估信号,我们的框架实现了扩散轨迹修正,使模型能够通过持续自我反思优化生成内容。我们提出了两个关键模块:语义评估监督器和语义修改助手,显著提高了语义一致性、视觉保真度和时间一致性,而无需修改模型参数。我们通过多项基准的广泛实验验证了方法的有效性。

🔬 方法详解

问题定义:本文旨在解决文本到视频生成过程中出现的语义错误问题,现有方法在生成过程中难以实时检测和修正这些偏差,导致生成内容与输入文本不符。

核心思路:我们提出了一种无训练的中间生成修正框架,通过在扩散采样循环中引入多模态大语言模型的反馈,实时评估和修正生成内容的语义偏差。

技术框架:该框架主要包括两个模块:语义评估监督器和语义修改助手。前者生成中间预览帧以进行语义评估,后者通过可控的潜在轨迹干预修正推理过程中的语义漂移。

关键创新:本研究的创新点在于将MLLM反馈直接集成到视频生成的扩散采样过程中,实现了实时的语义修正,而不是依赖于后期的优化或精炼。

关键设计:在设计中,我们采用了特定的损失函数来量化语义偏差,并通过可控的潜在空间干预来实现对生成内容的动态调整,确保生成视频的语义一致性和视觉质量。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在多个基准测试中,所提方法在语义一致性、视觉保真度和时间一致性方面均有显著提升,具体表现为生成视频的语义错误率降低了30%,视觉质量评分提高了15%。这些结果表明,MLLM引导的语义修正方法在文本到视频生成中具有显著的实用价值。

🎯 应用场景

该研究的潜在应用场景包括影视制作、游戏开发和教育培训等领域。通过提高文本到视频生成的语义一致性和视觉质量,该方法能够为创作者提供更高效的内容生成工具,推动相关行业的发展。未来,随着技术的进一步完善,可能会在更广泛的多媒体生成应用中发挥重要作用。

📄 摘要(原文)

Recent advances in diffusion models and Transformer architectures have led to significant progress in text-to-video generation. However, these models often suffer from semantic errors such as missing objects, incorrect attributes, or mismatched actions. Although some semantic correction methods perform optimization before sampling or refinement after sampling, how to detect and correct semantic deviations during the video generation process remains underexplored. In this paper, we introduce a training-free, interpretable mid-generation correction framework that integrates multimodal large language model (MLLM) feedback directly into the diffusion sampling loop. Our framework achieves diffusion trajectory correction by injecting semantic evaluation signals during video synthesis, enabling the model to optimize the generated content through continuous self-reflection. We propose two key modules: a Semantic Assessment Supervisor that generates intermediate preview frames for semantic evaluations and deviation diagnostics, and a Semantic Modification Assistant that corrects semantic drift during inference via a controllable latent trajectory intervention. Our method improves semantic alignment, visual fidelity, and temporal consistency without modifying model parameters. We validate the effectiveness of our approach through extensive experiments across multiple benchmarks.