Spatially-Grounded Text-to-Video Generation via Inference-Time Gradient-Free Optimization

📄 arXiv: 2608.13037v2 📥 PDF

作者: Guillaume Jeanneret, Mathis Koroglu, Hugo Caselles-Dupré, Arnaud Dapogny, Matthieu Cord

分类: cs.CV

发布日期: 2026-08-13 (更新: 2026-08-14)

备注: Camera Ready Version


💡 一句话要点

提出GATO-Vid以解决文本到视频生成中的空间控制问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control)

关键词: 文本到视频生成 空间控制 无梯度优化 解析轨迹优化 扩散变换器 计算机视觉 人工智能

📋 核心要点

  1. 现有的文本到视频生成方法在空间控制方面存在显著不足,尤其是在特定位置放置对象时的精确性。
  2. 本文提出的GATO-Vid采用无梯度的解析轨迹优化方法,通过交叉注意力分数的解析解实现空间引导。
  3. 实验结果显示,GATO-Vid在定位准确性上显著优于现有方法,且计算开销几乎不增加。

📝 摘要(中文)

扩散变换器文本到视频模型在合成质量上取得了显著进展,但细粒度的空间可控性仍然是一个重大挑战。现有的无训练方法在空间生成中表现良好,但依赖于基于梯度的优化技术,导致计算开销巨大,尤其是在现代大规模架构中。为了解决这一限制,本文提出了一种新的无训练、无梯度的方法——梯度自由解析轨迹优化视频生成(GATO-Vid),实现精确的空间引导。我们引入了一种替代的交叉注意力分数,并通过解析方法获得精确的闭式解。实验表明,GATO-Vid在定位准确性上显著优于现有基线,同时引入的计算开销极小。

🔬 方法详解

问题定义:本文旨在解决文本到视频生成中的空间控制问题,现有方法依赖于梯度优化,导致计算开销过大,影响效率。

核心思路:GATO-Vid通过引入解析解的方式,避免了传统方法中的反向传播计算,从而实现高效的空间引导。

技术框架:GATO-Vid的整体架构包括交叉注意力机制和解析解的注入机制,能够在变换器的潜在空间中进行高效优化。

关键创新:GATO-Vid的主要创新在于提出了一种无梯度的解析轨迹优化方法,显著降低了计算复杂度,与现有基于梯度的方法形成鲜明对比。

关键设计:在设计中,GATO-Vid采用了特定的参数设置和损失函数,以确保在优化过程中保持高效性和准确性,同时通过动态注入机制适应变换器的拓扑流形。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,GATO-Vid在定位准确性上比现有基线提高了显著的性能,具体提升幅度达到XX%(具体数据需根据实际实验结果填写),同时计算开销几乎不增加,展示了其高效性和实用性。

🎯 应用场景

该研究的潜在应用领域包括影视制作、游戏开发和虚拟现实等,能够为创作者提供更高效的工具来实现复杂场景的生成。未来,GATO-Vid可能会推动文本到视频生成技术的进一步发展,提升用户体验和创作自由度。

📄 摘要(原文)

Diffusion Transformer Text-to-Video models have achieved remarkable synthesis quality, yet fine-grained spatial controllability remains a significant challenge. While existing training-free methods produce solid overall results in spatially grounded generation, \ie, placing a specific object in a designated location, they rely on gradient-based optimization techniques that incur prohibitive computational overhead, a bottleneck amplified in modern large-scale architectures. To address this limitation, we present Gradient-free Analytical Trajectory Optimization Video Generation (GATO-Vid), a novel training-free and gradient-free approach for precise spatial guidance. Rather than relying on costly backward passes, we introduce an alternative cross-attention score and solve it analytically to obtain an exact, closed-form solution. To use our analytical solution, we propose an on-the-fly injection mechanism tailored to the topological manifold of the transformer's latent space. Our experiments demonstrate that GATO-Vid significantly outperforms existing baselines in localization accuracy while introducing minimal computational overhead.