CoinVE-200K: A Large-Scale High-Quality Dataset for Compositional Instruction-Guided Video Editing
作者: Fuchen Long, Cong Wang, Zitao Gao, Wenhao Zhong, Yu Cheng, Xiaolu Hou, Yan Li, Xiao Cao, Xinlong Sun, Xi Chen, Yu Liu
分类: cs.CV
发布日期: 2026-08-18
备注: Project page: https://coinve200k.github.io; Dataset is available at https://huggingface.co/datasets/FireCRT/CoinVE-200K; see source codes at https://github.com/coinve200k/CoinVE-200K
💡 一句话要点
提出CoinVE-200K以解决复合指令引导视频编辑问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 复合指令视频编辑 数据集构建 区域感知注意力 视频编辑模型 多样性与质量
📋 核心要点
- 现有视频编辑数据集主要集中于单一操作,无法有效支持复合指令的理解与执行,限制了视频编辑的灵活性与多样性。
- CoinVE-200K数据集通过包含多种复合场景和多种编辑操作,解决了复合指令引导视频编辑的挑战,并确保了数据的高质量与多样性。
- CoinVE-Edit模型在CoinVE-Bench基准上表现出色,展示了在指令跟随、编辑准确性、视觉质量和时间一致性等方面的显著提升。
📝 摘要(中文)
尽管现有的基于指令的视频编辑数据集质量和多样性不断提高,但主要集中于单一编辑操作,无法支持复合指令引导的视频编辑。为了解决这一问题,本文提出了CoinVE-200K,一个大规模高质量的数据集,包含1080p视频编辑对,涵盖多种复合场景,每个样本涉及2到5个原子编辑操作。所有样本通过精心设计的生成和过滤流程构建,以确保指令的真实性、视觉质量、时间一致性和组合多样性。此外,本文还引入了CoinVE-Bench作为复合指令视频编辑的基准,并提出了CoinVE-Edit,一个基于Wan2.1-T2V-14B和Qwen3-VL-8B-Instruct的22B复合视频编辑模型。
🔬 方法详解
问题定义:本文旨在解决现有视频编辑数据集中对复合指令支持不足的问题。现有方法多集中于单一编辑操作,无法有效处理多个编辑意图的联合理解与执行。
核心思路:提出CoinVE-200K数据集,涵盖多种复合场景和编辑操作,确保指令的真实性和视觉质量,从而支持复合指令引导的视频编辑。
技术框架:整体架构包括数据集生成、过滤流程和CoinVE-Edit模型。数据集通过多阶段生成和过滤,确保样本的高质量和多样性,模型则通过区域感知注意力机制实现精确的多区域编辑。
关键创新:CoinVE-200K数据集是首个专注于复合指令引导的视频编辑数据集,CoinVE-Edit模型通过区域感知注意力机制实现了对不同编辑指令的精确处理,显著提升了编辑效果。
关键设计:模型采用22B参数,结合Wan2.1-T2V-14B和Qwen3-VL-8B-Instruct,设计了特定的损失函数和网络结构,以优化指令跟随和编辑质量。通过区域感知机制,模型能够在保留无关内容的同时,实现时间一致性。
🖼️ 关键图片
📊 实验亮点
在CoinVE-Bench基准测试中,CoinVE-Edit模型在指令跟随、复合编辑准确性、视觉质量和时间一致性等方面表现优异,具体性能数据表明其在多个指标上均超过了现有基线,展示了显著的提升幅度。
🎯 应用场景
该研究的潜在应用领域包括电影制作、广告创作和社交媒体内容生成等。通过提供高质量的复合指令引导视频编辑工具,能够极大地提升创作者的工作效率和创作灵活性,推动视频编辑技术的发展。未来,该技术可能在自动化视频生成和个性化内容创作中发挥重要作用。
📄 摘要(原文)
The quality and diversity of instruction-based video editing datasets are steadily improving, yet existing datasets mainly focus on single editing operations and fall short in supporting compositional instruction-guided video editing. In particular, multiple editing intents must be jointly understood and faithfully executed within the same video. To address this issue, we introduce CoinVE-200K, a large-scale, high-quality dataset for Compositional Instruction-Guided Video Editing. CoinVE-200K contains 1080p video-editing pairs of up to 201 frames, covering diverse compositional scenarios where each sample involves 2 to 5 atomic editing operations. The instructions target humans, objects, and backgrounds, and cover edit types such as addition, removal, modification, and stylization. All samples are built through a carefully designed generation and filtering pipeline to ensure instruction faithfulness, visual quality, temporal consistency, and compositional diversity. We also introduce CoinVE-Bench, a benchmark for compositional-instruction video editing across diverse subjects, operation types, and instruction complexities. Furthermore, we present CoinVE-Edit, a 22B compositional video editing model built upon Wan2.1-T2V-14B and Qwen3-VL-8B-Instruct. CoinVE-Edit disentangles region-aware attention for different editing instructions, enabling precise multi-region editing while preserving irrelevant content and temporal coherence. Experiments on CoinVE-Bench show that CoinVE-Edit achieves strong performance in instruction following, compositional editing accuracy, visual quality, and temporal consistency.