Vorch-Omni: Multi-Task Orchestration of Sight and Sound
作者: Vorch Team, Xiaoyu Chen, Yang Ding, Cong Han, Menglin Han, Yuxin Hong, Jiebo Hou, Zequn Jie, Xiang Li, Jing Liu, Qi Liu, Yulei Lu, Siyuan Luo, Lin Ma, Xin Ma, Yinlong Qian, Peng Shi, Fang Wan, Siqi Wang, Yaohui Wang, Yaole Wang, Yidi Wu, Siqian Yang, Mingyu Yin, Haoran Yu, Gang Yue, Lisai Zhang, Yuting Zhang
分类: cs.CV
发布日期: 2026-08-06
备注: Project Page: https://vorch-project.github.io/Vorch-Omni-project/
💡 一句话要点
提出Vorch-Omni以解决多任务音视频生成问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture)
关键词: 多任务学习 音视频生成 统一框架 视觉语言模型 视频变分自编码器 生成模型 多模态融合
📋 核心要点
- 现有的音视频生成方法通常依赖于特定任务的模型,导致任务间干扰和灵活性不足。
- Vorch-Omni提出了一种统一的多任务框架,能够将视频和音频信号灵活地作为条件输入或生成目标。
- 该框架在不改变架构的情况下支持超过10种任务,展示了良好的扩展性和多样性。
📝 摘要(中文)
近年来生成视频建模的进展使得多样化生成、基于参考的合成、扩展和编辑成为可能,但现有方法往往依赖于碎片化的任务特定模型。Vorch-Omni是一个统一的多任务框架,能够灵活处理视频和音频信号,支持超过10种任务,包括文本到视频、图像和参考条件生成等。该框架通过引入位置类型和任务标识符来减少任务间的干扰,并采用视觉语言模型和视频变分自编码器来捕捉语义和结构信息。
🔬 方法详解
问题定义:本论文旨在解决现有音视频生成方法中任务特定模型的碎片化问题,导致任务间干扰和灵活性不足。
核心思路:Vorch-Omni通过将音视频信号视为条件输入或生成目标,采用统一的多任务框架来处理多样化的生成任务,减少任务间的干扰。
技术框架:该框架包括多个主要模块,如视觉语言模型用于解释采样帧,视频变分自编码器用于条件编码,以及分布式数据管道用于生成结构化的字幕和元数据。
关键创新:Vorch-Omni的核心创新在于其统一的多任务框架,能够在不进行任务特定架构更改的情况下,支持多种音视频生成任务,这是与现有方法的本质区别。
关键设计:该框架使用了令牌级条件掩码和任务标识符来区分目标、源内容和参考,同时采用位置类型来分离时间上下文与独立条件。
🖼️ 关键图片
📊 实验亮点
Vorch-Omni在多个任务上表现出色,支持超过10种生成任务,包括文本到视频和音频驱动生成等。与传统方法相比,该框架在任务灵活性和生成质量上有显著提升,展示了良好的扩展性和多样性。
🎯 应用场景
Vorch-Omni的研究成果在音视频生成和编辑领域具有广泛的应用潜力,包括电影制作、游戏开发、虚拟现实等。其统一框架为多模态内容创作提供了强大的支持,能够提升创作效率和内容质量。
📄 摘要(原文)
Recent advances in generative video modeling have enabled diverse generation, reference-based synthesis, extension, and editing, but existing approaches often rely on fragmented task-specific models. A general model must distinguish heterogeneous target, source, and reference signals to determine what to generate, preserve, or use as guidance, while reducing interference among tasks. Joint audio-visual generation further increases this challenge by introducing diverse conditioning and output configurations across modalities. We present Vorch-Omni, a unified multi-task framework for audio-visual synthesis based on an arbitrary-condition-to-arbitrary-output formulation. It flexibly treats video and audio signals as either conditioning inputs or generation targets. Token-level conditioning masks and task identifiers distinguish targets, source content, and references, while position types separate temporal context from independent conditions. To capture semantic and structural information, Vorch-Omni employs complementary visual conditioning pathways: a vision-language model interprets sampled frames with text instructions, and a video VAE encodes conditions into latent tokens for direct guidance. We further build a distributed data pipeline to curate diverse temporally aligned audio-visual clips, generate structured captions and metadata, and balance heterogeneous task distributions. Built on a single flow-matching diffusion transformer without task-specific architectural changes, Vorch-Omni supports over 10 tasks, including text-to-video, text-to-audio-video, image- and reference-conditioned generation, temporal extension, audio-driven generation, video transformation, and audio-visual editing. This unified framework provides a scalable foundation for general-purpose audio-visual generation and manipulation.