Ex-Omni-2D: Expressive Omni-Modal Dialogue Models with Native Visual Presence

📄 arXiv: 2608.10720v1 📥 PDF

作者: Haoyu Zhang, Zhipeng Li, Xiaoying Tang, Tianshu Yu, Yiwen Guo

分类: cs.AI, cs.CL, cs.CV

发布日期: 2026-08-11


💡 一句话要点

提出Ex-Omni-2D以解决多模态对话生成的视觉缺失问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态对话 视觉思维计划 声学-时间接口 个性化语音 视频生成 蒸馏训练 人机交互

📋 核心要点

  1. 现有的多模态对话模型在生成响应时缺乏视觉表现,导致其输出显得不够生动和直观。
  2. Ex-Omni-2D框架通过生成结构化的视觉思维计划(VTP)和协调的文本、语音及视频响应,解决了这一问题。
  3. 实验结果表明,该模型在效率和质量上均有显著提升,四GPU管道实现了1.293的实时因子,具备实用性。

📝 摘要(中文)

多模态对话模型能够理解多种输入并合成语音回复,但其响应仍然缺乏视觉表现。本文提出了Ex-Omni-2D,一个多模态对话框架,生成包含文本、个性化语音和参考条件视频的协调响应。给定多模态查询、参考图像和参考音频,模型预测一个结构化的视觉思维计划(VTP),描述场景、情感和动作,随后生成响应文本和原生多代码本语音单元。这些单元形成一个共享的声学-时间接口,能够在线对齐视频帧,避免了对大规模查询-文本-语音-视频监督的需求。通过四步推理,完整的四GPU管道在400×720/720×400分辨率下实现了1.293的端到端实时因子(RTF),提供了一个实用的质量-效率操作点。

🔬 方法详解

问题定义:现有的多模态对话模型在生成响应时,往往缺乏视觉表现,导致输出的内容显得生硬和不够直观。用户期望能够看到与对话内容相关的视觉信息,以增强交互体验。

核心思路:Ex-Omni-2D框架的核心思想是通过生成一个结构化的视觉思维计划(VTP),将文本、个性化语音和参考视频结合起来,从而实现更生动的多模态响应。该设计旨在通过视觉信息的引入,提升对话的表现力和用户体验。

技术框架:该框架包括多个主要模块:首先,接收多模态查询、参考图像和参考音频;然后,生成视觉思维计划(VTP),描述场景、情感和动作;接着,生成响应文本和多代码本语音单元;最后,通过全序列视频生成器进行输出。

关键创新:最重要的技术创新在于引入了共享的声学-时间接口,使得语音单元能够在线与视频帧对齐。这一设计避免了对大规模监督数据的依赖,提升了模型的灵活性和适应性。

关键设计:在模型设计中,采用了几步块因果蒸馏方法,利用前缀流机制在连续块之间传递干净的潜在信息,以减少后续块的累积降级。此外,损失函数和网络结构经过精心设计,以确保生成的响应在质量和效率上达到最佳平衡。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

实验结果显示,Ex-Omni-2D在400×720/720×400分辨率下实现了1.293的端到端实时因子(RTF),展现出优越的效率和响应质量。与现有基线相比,该模型在多模态对话生成任务中显著提升了表现,具备实用性和可扩展性。

🎯 应用场景

Ex-Omni-2D的研究成果在多个领域具有潜在应用价值,包括虚拟助手、教育培训、娱乐和社交媒体等。通过提供更具表现力的多模态对话,能够提升用户的交互体验,促进人机交互的自然性和流畅性。未来,该技术有望在增强现实和虚拟现实等新兴领域中发挥重要作用。

📄 摘要(原文)

Omni-modal dialogue models can understand multimodal inputs and synthesize spoken replies, yet their responses remain visually disembodied. We introduce \textbf{Ex-Omni-2D}, an omni-modal dialogue framework that generates a coordinated response comprising text, personalized speech, and reference-conditioned video. Given a multimodal query, reference image, and reference audio, the model predicts a structured \textit{Visual Thought Plan} (VTP) describing scene, emotion, and motion, followed by response text and native multi-codebook speech units. These units form a shared acoustic-temporal interface: they are decoded into speech and aligned online with video frames. This interface enables the response and avatar pathways to be learned from heterogeneous speech, dialogue, and avatar-video data, avoiding the need for large-scale query--text--speech--video supervision. A full-sequence Video Generator serves as the primary Teacher. For efficient incremental generation, we further distill it into a few-step block-causal \emph{Streaming Student} whose Prefix Streaming mechanism carries a clean latent across consecutive chunks to reduce cumulative late-chunk degradation. With four-step inference, the complete four-GPU pipeline achieves an end-to-end RTF of 1.293 at $400\times720$/$720\times400$, providing a practical quality--efficiency operating point.