SeMoCo: A Semantic-First Motion Codec for Motion Language Modeling

📄 arXiv: 2608.24334v1 📥 PDF

作者: Tianlv Huang, Hetian Guo, Ziyi Cai, Song Wang, Yanping Zhang, Zipei Fan, Xuan Song, Guangming Wu, Xin Zheng

分类: cs.CV, cs.CL, cs.GR

发布日期: 2026-08-25


💡 一句话要点

提出SeMoCo以解决运动语言建模中的语义编码问题

🎯 匹配领域: 支柱四:生成式动作 (Generative Motion) 支柱七:动作重定向 (Motion Retargeting) 支柱八:物理动画 (Physics-based Animation) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 运动编码 语义建模 自回归生成 人类运动数据集 多源数据整合

📋 核心要点

  1. 现有的运动标记器主要优化于重建,未能有效分配语义角色,导致动作意义和运动学细节的编码不足。
  2. SeMoCo通过引入语义优先的运动编解码器和双轴运动生成器,解决了运动表示中的语义与运动学细节的编码问题。
  3. 实验结果表明,SeMoCo在重建精度上优于其他编解码器,并在文本到运动生成任务中表现出色,验证了其运动标记的有效性。

📝 摘要(中文)

离散运动表示在自回归文本到运动生成中取得了显著进展。然而,大多数运动标记器优化于重建,并未根据语义角色明确分配容量。因此,动作级意义和细粒度运动学细节必须通过相同的重建驱动层次进行编码。本文提出了SeMoCo,一种以语义为先的运动编解码器,以及用于语言条件运动生成的双轴运动生成器。每个运动标记包含一个语义标记和一系列运动学标记的残差序列。生成器在时间上建模语义进展,并自回归地细化残差条目。此外,我们构建了$Ω$-MotionVerse,一个统一在SOMA表示下的大规模多源人类运动数据集。SeMoCo在比较中实现了最佳的重建精度,而强大的文本到运动结果则展示了其运动标记在下游生成中的有效性。

🔬 方法详解

问题定义:本文旨在解决现有运动标记器在语义角色分配上的不足,导致动作级意义和细粒度运动学细节的编码不够有效。

核心思路:SeMoCo采用语义优先的设计理念,每个运动标记由一个语义标记和一系列运动学标记的残差序列组成,从而实现语义与运动学信息的有效分离与编码。

技术框架:整体架构包括一个运动编解码器和一个双轴运动生成器。运动编解码器负责将输入的运动数据转换为离散运动标记,而双轴运动生成器则根据语言条件生成运动序列,逐步细化运动学信息。

关键创新:SeMoCo的主要创新在于其语义优先的运动编码方式,显著区别于传统方法的重建驱动层次结构,使得语义信息和运动学细节能够独立处理。

关键设计:在设计中,运动标记的构成、损失函数的选择以及网络结构的优化都是关键因素,确保了生成器在时间上的语义进展建模和残差条目的自回归细化。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在实验中,SeMoCo在重建精度上表现出色,超越了其他对比编解码器,具体性能数据未提供,但其在文本到运动生成任务中的强大表现验证了运动标记的有效性,显示出显著的提升幅度。

🎯 应用场景

SeMoCo的研究成果在动画制作、虚拟现实和游戏开发等领域具有广泛的应用潜力。通过更有效的运动生成,能够提升人机交互的自然性和流畅性,进而推动相关技术的发展与应用。

📄 摘要(原文)

Discrete motion representations have substantially advanced autoregressive text-to-motion generation. However, most motion tokenizers are optimized for reconstruction and do not explicitly allocate capacity according to semantic role. Action-level meaning and fine-grained kinematic detail must therefore be encoded through the same reconstruction-driven hierarchy. We introduce SeMoCo, a semantic-first motion codec, together with a dual-axis motion generator for language-conditioned motion generation. Each motion token contains one semantic token and a residual sequence of kinematic tokens. The generator models semantic progression across time and autoregressively refines the residual entries. We also construct $Ω$-MotionVerse, a large-scale, multi-source human-motion dataset unified under the SOMA representation. Across the reported comparisons, SeMoCo achieves the best reconstruction accuracy among the compared codecs, while strong text-to-motion results demonstrate the effectiveness of its motion tokens for downstream generation.