Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds

📄 arXiv: 2608.23383v1 📥 PDF

作者: Nan Duan, Haoyang Huang, Weiyang Jin, Haoran Li, Yaowei Li, Yuming Li, Yijun Liu, Xin Lu, Xiaoxiao Ma, Yanwen Ma, Yaofeng Su, Yilang Sun, Haoyu Wang, Zeyue Xue, Songchun Zhang, Junhao Zhuang

分类: cs.CV

发布日期: 2026-08-24

备注: Project page: https://echo-team-joy-future-academy-jd.github.io/Echo-1.5-Page/

🔗 代码/项目: PROJECT_PAGE


💡 一句话要点

提出JoyAI-Echo-1.5以解决长视频生成中的一致性与交互性问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 长视频生成 音视频生成 跨镜头记忆 几何感知 用户交互 深度学习 多模态融合

📋 核心要点

  1. 现有的视频生成方法在长视频生成中面临角色一致性和用户交互控制的挑战,难以实现稳定的长时间输出。
  2. 本文提出的JoyAI-Echo-1.5通过引入可组合的跨镜头记忆和几何感知的条件路径,解决了长视频生成中的一致性和交互性问题。
  3. 实验结果显示,JoyAI-Echo-1.5在多个指标上超越了现有基线,特别是在WBench上获得了81.7的平均分,展现了卓越的视觉质量和长时间一致性。

📝 摘要(中文)

视频生成正从孤立的短片向长篇叙事和互动世界发展,这要求模型在长时间的生成过程中保持角色身份、遵循用户控制并保持稳定性。本文提出了JoyAI-Echo-1.5,一个统一的音视频生成系统,包含两个专门设计的变体。长视频变体引入了可组合的跨镜头记忆,聚合多个先前镜头的视觉证据和从语音过滤的全镜头音频中提取的说话者线索,从而实现角色外观和声音身份的持久性。世界模型变体将异构导航输入转换为校准的六自由度相机轨迹,并通过几何感知的条件路径注入,实现跨灵活视角的控制器无关交互。实验表明,JoyAI-Echo-1.5在跨镜头一致性、视觉质量、文本对齐和语音保真度等方面优于现有的长视频基线。

🔬 方法详解

问题定义:本文旨在解决长视频生成中的角色一致性、用户交互控制和生成稳定性等问题。现有方法在处理长时间序列时,往往无法有效保持角色的身份和外观,导致生成内容的连贯性不足。

核心思路:论文提出的JoyAI-Echo-1.5系统通过引入可组合的跨镜头记忆和几何感知的条件路径,增强了模型在长视频生成中的表现。这样的设计使得模型能够在多个镜头之间聚合信息,从而实现角色的持久性和一致性。

技术框架:JoyAI-Echo-1.5包含两个主要变体:长视频变体和世界模型变体。长视频变体通过跨镜头记忆聚合视觉信息,而世界模型变体则将导航输入转换为六自由度相机轨迹,支持灵活的视角交互。

关键创新:最重要的技术创新在于引入了可组合的跨镜头记忆和几何感知的条件路径,这与现有方法的单一镜头处理方式形成了鲜明对比,显著提升了生成内容的连贯性和交互性。

关键设计:在模型设计中,采用了双向音视频骨干网络,并通过渐进式教师强迫和短期与长期自梯度强迫进行训练,确保了生成过程的高效性和稳定性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,JoyAI-Echo-1.5在跨镜头一致性、视觉质量、文本对齐和语音保真度等方面显著优于现有基线,特别是在WBench上获得81.7的平均分,展示了其在长视频生成中的领先地位。

🎯 应用场景

该研究的潜在应用领域包括游戏开发、虚拟现实和教育等,能够为用户提供更加沉浸和互动的体验。通过生成连贯的故事和动态的互动世界,JoyAI-Echo-1.5有望在娱乐和教育领域带来深远的影响。

📄 摘要(原文)

Video generation is progressing beyond isolated clips toward long-form narratives and interactive worlds, requiring models to preserve identities, follow user controls, and remain stable over extended rollouts. We present JoyAI-Echo-1.5, a unified audio-visual generation system with two purpose-built variants. The long-video variant introduces composable cross-shot memory that aggregates visual evidence across multiple prior shots and speaker cues derived from speech-filtered full-shot audio, enabling persistent character appearance and voice identity across flexible combinations of text, image, and memory conditioning. The world-model variant converts heterogeneous navigation inputs into calibrated metric 6-DoF camera trajectories and injects them through a geometry-aware conditioning pathway, enabling controller-agnostic interaction across flexible viewpoints. To support efficient long-horizon generation, we transform a bidirectional audio-visual backbone into a causal few-step generator using progressive teacher forcing and short- and long-horizon Self-Gradient Forcing on self-generated rollouts. Experiments demonstrate strong performance in both settings. JoyAI-Echo-1.5 achieves improvements over existing long-video baselines in cross-shot consistency, visual quality, text alignment, and speech fidelity. Its world-model variant ranks first on WBench, with an average score of 81.7, and achieves leading visual quality and long-horizon persistence on SANA-WM-Bench. Together, these results indicate that memory, geometric control, and rollout-aware training provide a practical foundation for generating coherent stories and continuously evolving interactive worlds. Project page: https://echo-team-joy-future-academy-jd.github.io/Echo-1.5-Page/.