Motion Beyond Morphology: Bootstrapping Cross-Category Motion Transfer from Abstract Motion Representations

📄 arXiv: 2608.01628v1 📥 PDF

作者: Zhixue Fang, Zhimin Zhang, Bi'an Du, Zijie Meng, Yan Zhou, Wei Hu, Guoxin Zhang, Pengfei Wan, Kun Gai

分类: cs.CV

发布日期: 2026-08-03

🔗 代码/项目: PROJECT_PAGE


💡 一句话要点

提出超越形态的运动转移方法以解决视频动画问题

🎯 匹配领域: 支柱七:动作重定向 (Motion Retargeting) 支柱八:物理动画 (Physics-based Animation)

关键词: 视频运动转移 多粒度学习 跨类别生成 动态保留 动画制作

📋 核心要点

  1. 现有视频运动转移方法依赖于固定的结构对应关系,导致在形态差异大的情况下效果不佳。
  2. 本文提出的两阶段框架通过学习多粒度抽象运动视图,实现了跨类别视频对的运动转移。
  3. 实验结果显示,该方法在运动保真度和目标保留方面超越了现有的最先进技术。

📝 摘要(中文)

视频运动转移旨在利用参考视频中的动态为目标对象进行动画制作。现有方法依赖于固定的结构对应关系,当参考对象与目标对象在形态、关节或变形机制上存在显著差异时,这种对应关系会变得不明确。本文提出了超越形态的运动转移视角,旨在保留在不同目标形态间仍然有意义的动态。为实现这一目标,我们提出了一个两阶段框架,第一阶段学习互补的多粒度抽象运动视图,并利用这些视图引导跨类别视频对的生成,第二阶段则将这种监督内化为直接的参考视频条件生成,消除了推理时对显式运动提取的需求。我们还引入了OpenVMT-Dataset和OpenVMT-Bench用于训练和评估图像及文本条件下的运动转移,实验结果表明该方法在运动保真度和目标保留方面达到了最先进的水平。

🔬 方法详解

问题定义:本文旨在解决视频运动转移中因目标对象与参考对象在形态上存在显著差异而导致的固定结构对应关系不明确的问题。现有方法在处理不同形态的对象时,往往无法有效转移运动信息。

核心思路:论文提出的核心思路是超越固定的结构对应,通过保留在不同目标形态间仍然有意义的动态来实现运动转移。这种设计允许在形态差异较大的情况下,仍能有效地转移运动信息。

技术框架:整体框架分为两个阶段。第一阶段学习多粒度的抽象运动视图,并利用这些视图生成跨类别的视频对;第二阶段则将这种监督内化为直接的参考视频条件生成,避免了推理时的显式运动提取。

关键创新:最重要的技术创新在于引入了多粒度抽象运动视图的学习机制,使得运动转移不再依赖于固定的结构对应关系。这一方法与现有技术的本质区别在于其灵活性和适应性,能够处理形态差异较大的对象。

关键设计:在关键设计上,论文采用了特定的损失函数来优化运动保真度和目标保留,同时在网络结构上进行了调整,以支持多粒度抽象运动视图的学习。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,提出的方法在运动保真度和目标保留方面达到了最先进的水平,具体性能数据在与现有基线的对比中显示出显著提升,尤其是在处理形态差异大的对象时,运动转移效果更为优越。

🎯 应用场景

该研究的潜在应用领域包括动画制作、游戏开发和虚拟现实等,能够为不同形态的对象提供更自然的运动转移效果。其实际价值在于提升了动画生成的灵活性和真实感,未来可能对影视和游戏行业产生深远影响。

📄 摘要(原文)

Video motion transfer aims to animate a target object using dynamics from a reference video. Existing formulations largely rely on fixed structural correspondence, which becomes ill-defined when reference and target objects differ substantially in morphology, articulation, or deformation mechanisms. We introduce Motion Beyond Morphology, a perspective that seeks to transfer motion beyond fixed structural correspondence, by preserving dynamics that remain meaningful across different target morphologies. To realize this, we propose a two-stage framework. Stage~I learns complementary multi-granularity abstract motion views and uses them to bootstrap cross-category video pairs that preserve transferable dynamics across diverse morphologies. Stage~II internalizes this supervision into direct reference-video-conditioned generation, removing the need for explicit motion extraction at inference. We further introduce OpenVMT-Dataset and OpenVMT-Bench for training and evaluating image- and text-conditioned motion transfer across Same, Near, and Far category gaps, and plan to release both upon acceptance. Extensive experiments demonstrate state-of-the-art motion fidelity and target preservation. Project page: https://miniz233.github.io/MotionBeyondMorphology/