GenPrior: Unleashing Text-to-Motion Generative Priors for Zero-Shot Skeleton-based Action Recognition

📄 arXiv: 2608.02236v1 📥 PDF

作者: Jidong Kuang, Hongsong Wang, Jie Gui

分类: cs.CV

发布日期: 2026-08-03

备注: Accepted by ACMMM 2026

🔗 代码/项目: GITHUB


💡 一句话要点

提出GenPrior以解决零样本骨架动作识别中的语义-运动差距问题

🎯 匹配领域: 支柱四:生成式动作 (Generative Motion)

关键词: 零样本识别 骨架动作识别 生成模型 特征融合 深度学习

📋 核心要点

  1. 现有的零样本骨架动作识别方法依赖于文本派生原型,缺乏几何结构和物理约束,导致语义-运动差距明显。
  2. 我们提出GenPrior框架,利用预训练的文本到运动模型生成先验,通过分散门控特征融合和生成原型精炼来提升识别性能。
  3. 在NTU-60、NTU-120和PKU-MMD数据集上的实验结果表明,GenPrior在零样本和广义零样本设置下均实现了显著的性能提升。

📝 摘要(中文)

零样本骨架动作识别(ZSAR)旨在通过对齐骨架特征与文本语义来识别未见过的动作类别。然而,现有方法依赖于缺乏几何结构和物理约束的文本派生原型,导致显著的语义-运动差距。为此,我们提出了GenPrior,这是第一个利用预训练的文本到运动(T2M)模型生成先验的框架。具体而言,我们引入了分散门控特征融合,提取运动序列中的运动原型和类内分散,并通过学习的门控网络自适应地将可靠的结构线索注入文本嵌入,同时抑制合成伪影。此外,我们提出了生成原型精炼,利用这些增强的原型作为锚点挖掘高置信度的未见样本,从而校准类原型向真实分布,显著提升性能。大量实验表明,GenPrior在NTU-60、NTU-120和PKU-MMD数据集上,在零样本和广义零样本设置下均取得了最先进的性能。

🔬 方法详解

问题定义:本论文旨在解决零样本骨架动作识别中的语义-运动差距问题。现有方法依赖于缺乏几何结构的文本派生原型,导致无法有效识别未见过的动作类别。

核心思路:我们提出的GenPrior框架利用预训练的文本到运动模型生成先验,通过提取运动序列中的运动原型和类内分散,增强文本嵌入的结构信息,从而缩小语义与运动之间的差距。

技术框架:GenPrior的整体架构包括两个主要模块:分散门控特征融合和生成原型精炼。前者通过学习的门控网络将运动序列中的结构线索注入文本嵌入,后者则利用生成增强的原型作为锚点来挖掘高置信度的未见样本。

关键创新:本研究的关键创新在于首次将生成先验应用于零样本骨架动作识别,利用生成模型的输出作为结构线索,显著提升了识别精度。这一方法与传统依赖文本原型的方式本质上不同。

关键设计:在技术细节上,我们设计了一个门控网络来适应性地融合运动特征,并使用特定的损失函数来优化生成原型的精炼过程,以确保生成的原型能够更好地代表真实的动作类别分布。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在NTU-60、NTU-120和PKU-MMD数据集上,GenPrior在零样本和广义零样本设置下均实现了最先进的性能,具体提升幅度达到XX%,显著超越了现有基线方法,验证了其有效性和优越性。

🎯 应用场景

该研究的潜在应用领域包括智能监控、虚拟现实和人机交互等场景,能够在未见过的动作类别中实现高效识别,提升系统的智能化水平。未来,该技术可能推动更多基于动作识别的应用发展,尤其是在动态环境中的实时识别任务。

📄 摘要(原文)

Zero-shot skeleton-based action recognition (ZSAR) aims to recognize unseen action categories by aligning skeleton features with textual semantics. However, existing methods rely on text-derived prototypes that inherently lack geometric structure and physical constraints, resulting in a pronounced \textit{semantic-kinematic gap}. To bridge this gap, we propose \textbf{GenPrior}, the first framework to exploit generative priors from pre-trained Text-to-Motion (T2M) models for ZSAR. Specifically, we introduce Dispersion-Gated Feature Fusion, which distills kinematic prototypes and intra-class dispersion from generative motion sequences and employs a learned gating network to adaptively inject reliable structural cues into textual embeddings while suppressing synthetic artifacts. Furthermore, we propose Generative Prototype Refinement, which leverages these generation-enhanced prototypes as anchors to mine high-confidence unseen samples, calibrating class prototypes toward the true distribution and thereby unleashing strong performance gains. Extensive experiments on NTU-60, NTU-120, and PKU-MMD demonstrate that GenPrior achieves state-of-the-art performance under both zero-shot and generalized zero-shot settings. Code is available at https://github.com/jidongkuang/GenPrior.