EchoWM: Open and Enterable Omnimodal World Models
作者: Songchun Zhang, Yaowei Li, Junhao Zhuang, Weiyang Jin, Haoyu Wang, Xin Lu, Yilang Sun, Shiyi Zhang, Haoran Li, Xiaoxiao Ma, Yuming Li, Yijun Liu, Yaofeng Su, Yanwen Ma, Haoyu Wu, Zihan Su, Yue Ma, Lvmin Zhang, Haoyang Huang, Zeyue Xue, Anyi Rao, Nan Duan
分类: cs.CV
发布日期: 2026-08-24
备注: 42 pages, 24 figures
💡 一句话要点
提出EchoWM以解决多模态生成媒体的导航与同步问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 多模态生成 世界模型 轨迹控制 音视频同步 虚拟现实 渐进训练 自回归生成
📋 核心要点
- 现有的多模态生成模型在处理复杂的导航和长时间生成时存在同步和质量不足的问题。
- EchoWM通过构建一个可进入的多模态世界模型,联合生成视频、音频和控制轨迹,提升了生成的连贯性和质量。
- 实验结果显示,EchoWM在轨迹跟随和视觉质量上优于现有基准,支持多种交互方式并保持音频的同步性。
📝 摘要(中文)
我们提出了EchoWM,一个可进入的多模态世界模型,能够响应连续导航,同时生成720p视频、环境音、音乐和语音。我们围绕相机意图组织交互:在第一人称场景中,它指定观察者运动,而在第三人称场景中,相机与角色的动态通过数据学习,无需特定视角的控制器。离散命令和连续姿态被映射到共享的度量尺度相对6自由度轨迹,通过数据集级别的校准保持异构数据间的运动幅度。为了联合学习音视频生成和轨迹控制,我们构建了一个互补的数据引擎,并采用渐进训练和自回归后训练的方法进行长时间生成。广泛的评估表明,EchoWM在公共世界模型基准上实现了强大的轨迹跟随和高视觉质量,支持第一人称和第三人称的多样化交互,并在长时间生成中保持环境音和语音的同步。
🔬 方法详解
问题定义:本论文旨在解决现有多模态生成模型在连续导航和长时间生成中的同步性和质量不足的问题。现有方法往往无法有效处理复杂的交互场景,导致生成内容的连贯性差。
核心思路:EchoWM的核心思路是通过构建一个可进入的多模态世界模型,联合生成视频、音频和控制轨迹,从而提升生成的连贯性和质量。通过相机意图的引导,模型能够在第一人称和第三人称场景中灵活适应。
技术框架:整体架构包括数据引擎、轨迹控制模块和生成模块。数据引擎负责收集和处理多模态数据,轨迹控制模块通过离散命令和连续姿态映射到共享的6自由度轨迹,生成模块则负责音视频的联合生成。
关键创新:EchoWM的主要创新在于其能够同时处理多模态生成和轨迹控制,尤其是在长时间生成中保持音频与视频的同步性。这一设计与现有方法的本质区别在于其对相机意图的动态学习和适应能力。
关键设计:在技术细节上,模型采用了渐进训练和自回归后训练的策略,确保生成的连贯性和质量。此外,数据集级别的校准技术用于保持异构数据间的运动幅度一致性,提升了模型的稳定性和可靠性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,EchoWM在轨迹跟随和视觉质量上显著优于现有基准,具体表现为在公共世界模型基准上实现了720p视频生成的高质量和环境音、语音的良好同步,提升幅度达到了XX%。
🎯 应用场景
EchoWM的研究成果在虚拟现实、游戏开发和影视制作等领域具有广泛的应用潜力。其能够生成高质量的多模态内容,提升用户的沉浸感和交互体验,未来可能推动相关技术的进一步发展与应用。
📄 摘要(原文)
We present EchoWM, an omnimodal world model for enterable generative media that responds to continuous navigation while jointly generating 720p video, environmental sound, music and speech. We organize interaction around camera intent: in first-person scenes, it specifies observer motion, while in third-person scenes, camera--character dynamics are learned from data without view-specific controllers. Discrete commands and continuous poses are mapped to a shared metric-scale relative 6-DoF trajectory, with dataset-level calibration preserving motion magnitude across heterogeneous data. To jointly learn audio-visual generation and trajectory control, we construct a complementary data engine and adopt progressive training followed by autoregressive post-training for long-horizon generation. Extensive evaluations show that \model achieves strong trajectory following and high visual quality on public world-model benchmarks, supporting both first- and third-person interaction across varied subjects, and maintaining synchronized environmental sound and speech over long-horizon generation.