EffectLearner: World-Aware Object-Effect Reasoning for Real-World Video Object Removal

📄 arXiv: 2608.05565v1 📥 PDF

作者: Feier Wu, Wanke Xia, Xu He, Zilang Zhou, Si Chen, Dongxia Liu, Liyang Chen, Qimeng Wu, Zhengbo Zhang, Wenming Yang, Zhiyong Wu

分类: cs.CV

发布日期: 2026-08-06

备注: Project: https://morleyolsen.github.io/EffectLearner/


💡 一句话要点

提出EffectLearner以解决复杂视频对象去除问题

🎯 匹配领域: 支柱八:物理动画 (Physics-based Animation)

关键词: 视频对象去除 效果推理 多模态学习 运动感知 复杂场景处理 深度学习 数据集构建

📋 核心要点

  1. 现有视频对象去除方法在处理复杂场景时,难以有效去除对象及其引发的多样化效果,导致恢复质量下降。
  2. 本文提出EffectLearner框架,通过结合视觉语言模型和Diffusion Transformer,增强对象-效果推理能力,实现更全面的去除效果。
  3. 在标准数据集ROSE-Bench上,EffectLearner在多个指标上超越基线,特别是在复杂场景下的表现显著提升,验证了其有效性。

📝 摘要(中文)

视频对象去除不仅需要消除目标对象,还需去除其引发的效果,同时保持高保真度和时空一致性。现有方法主要从预定义的效果类别和固定数据分布中隐式学习对象-效果对应关系,限制了其在复杂真实场景中的泛化能力。为此,本文提出了EffectLearner,一个结合了基于视觉语言模型的对象-效果推理器和基于Diffusion Transformer的视频去除器的框架。通过结构化的效果分析提示,推理器在目标高亮视频上进行跨模态推理,提取紧凑的效果感知上下文,指导视频去除器进行全面的对象-效果去除。运动感知的掩膜引导和运动一致性监督进一步提高了在对象运动和场景动态演变下的去除覆盖率和时空稳定性。我们还构建了EffectWorld,一个专门设计用于复杂对象引发效果的配对视频数据集,并引入了结合常规监督与复杂效果数据的渐进训练课程。在标准ROSE-Bench上,EffectLearner在大多数指标上超越了现有基线,并在EffectWorld-Eval和具有挑战性的EffectWorld-Wild上表现出明显优势,展示了其在复杂真实场景中提供高质量视频对象去除的能力。

🔬 方法详解

问题定义:本文旨在解决视频对象去除中的对象及其引发效果的全面去除问题。现有方法依赖于固定的数据分布和预定义的效果类别,导致在复杂场景中的泛化能力不足。

核心思路:EffectLearner通过引入基于视觉语言模型的对象-效果推理器,结合视频去除器,增强了对对象及其效果的理解和处理能力,从而实现更高质量的去除效果。

技术框架:整体架构包括两个主要模块:对象-效果推理器和视频去除器。推理器通过结构化提示进行跨模态推理,提取效果感知上下文,指导去除器进行对象及效果的综合去除。

关键创新:最重要的创新在于引入了运动感知掩膜引导和运动一致性监督,这些设计显著提高了在动态场景下的去除效果和时空稳定性。

关键设计:在模型设计中,采用了结构化效果分析提示,结合了复杂效果数据的渐进训练课程,优化了损失函数以增强模型的学习能力。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在标准ROSE-Bench上,EffectLearner在大多数指标上超越了现有基线,特别是在EffectWorld-Eval和EffectWorld-Wild上表现出明显优势,验证了其在复杂真实场景中进行高质量视频对象去除的能力,提升幅度显著。

🎯 应用场景

EffectLearner的研究成果可广泛应用于视频编辑、电影制作、虚拟现实等领域,尤其是在需要高质量对象去除和效果处理的场景中。其高效的去除能力和对复杂场景的适应性,将推动相关技术的发展和应用,提升用户体验。

📄 摘要(原文)

Video object removal must eliminate not only the target object but also its induced effects while maintaining high-fidelity and spatiotemporally coherent restoration. Existing methods mainly learn object-effect correspondences implicitly from predefined effect categories and fixed data distributions, limiting their generalization to complex real-world scenes involving compositional effects, spatially detached or weakly correlated effects, long-tail physical phenomena, and dynamically evolving interactions. We propose EffectLearner, a semantic-reasoning-enhanced framework that combines a VLM-based Object-Effect Reasoner with a DiT-based Video Eraser. Guided by a structured effect-analysis prompt, the Reasoner performs cross-modal reasoning over a target-highlighted video and extracts compact effect-aware context, which guides the Video Eraser toward comprehensive object-effect removal. Motion-aware mask guidance and motion-consistency supervision further improve removal coverage and spatiotemporal stability under object motion and evolving scene dynamics. To fully exploit the framework in challenging real-world scenarios, we further construct EffectWorld, a paired video dataset specifically designed for complex object-induced effects, and introduce a progressive training curriculum that combines common supervision with complex-effect data. On the standard ROSE-Bench, EffectLearner outperforms existing baselines on most metrics and achieves clear advantages on both EffectWorld-Eval and the challenging EffectWorld-Wild, demonstrating its ability to deliver high-quality video object removal in complex real-world scenes.