GenPrior: Unleashing Text-to-Motion Generative Priors for Zero-Shot Skeleton-based Action Recognition
作者: Jidong Kuang, Hongsong Wang, Jie Gui
分类: cs.CV
发布日期: 2026-08-03
备注: Accepted by ACMMM 2026
🔗 代码/项目: GITHUB
💡 一句话要点
提出GenPrior以解决零样本骨架动作识别中的语义-运动差距问题
🎯 匹配领域: 支柱四:生成式动作 (Generative Motion)
关键词: 零样本识别 骨架动作识别 生成模型 特征融合 深度学习
📋 核心要点
- 现有的零样本骨架动作识别方法依赖于文本派生原型,缺乏几何结构和物理约束,导致语义-运动差距明显。
- 我们提出GenPrior框架,利用预训练的文本到运动模型生成先验,通过分散门控特征融合和生成原型精炼来提升识别性能。
- 在NTU-60、NTU-120和PKU-MMD数据集上的实验结果表明,GenPrior在零样本和广义零样本设置下均实现了显著的性能提升。
📝 摘要(中文)
零样本骨架动作识别(ZSAR)旨在通过对齐骨架特征与文本语义来识别未见过的动作类别。然而,现有方法依赖于缺乏几何结构和物理约束的文本派生原型,导致显著的语义-运动差距。为此,我们提出了GenPrior,这是第一个利用预训练的文本到运动(T2M)模型生成先验的框架。具体而言,我们引入了分散门控特征融合,提取运动序列中的运动原型和类内分散,并通过学习的门控网络自适应地将可靠的结构线索注入文本嵌入,同时抑制合成伪影。此外,我们提出了生成原型精炼,利用这些增强的原型作为锚点挖掘高置信度的未见样本,从而校准类原型向真实分布,显著提升性能。大量实验表明,GenPrior在NTU-60、NTU-120和PKU-MMD数据集上,在零样本和广义零样本设置下均取得了最先进的性能。
🔬 方法详解
问题定义:本论文旨在解决零样本骨架动作识别中的语义-运动差距问题。现有方法依赖于缺乏几何结构的文本派生原型,导致无法有效识别未见过的动作类别。
核心思路:我们提出的GenPrior框架利用预训练的文本到运动模型生成先验,通过提取运动序列中的运动原型和类内分散,增强文本嵌入的结构信息,从而缩小语义与运动之间的差距。
技术框架:GenPrior的整体架构包括两个主要模块:分散门控特征融合和生成原型精炼。前者通过学习的门控网络将运动序列中的结构线索注入文本嵌入,后者则利用生成增强的原型作为锚点来挖掘高置信度的未见样本。
关键创新:本研究的关键创新在于首次将生成先验应用于零样本骨架动作识别,利用生成模型的输出作为结构线索,显著提升了识别精度。这一方法与传统依赖文本原型的方式本质上不同。
关键设计:在技术细节上,我们设计了一个门控网络来适应性地融合运动特征,并使用特定的损失函数来优化生成原型的精炼过程,以确保生成的原型能够更好地代表真实的动作类别分布。
🖼️ 关键图片
📊 实验亮点
在NTU-60、NTU-120和PKU-MMD数据集上,GenPrior在零样本和广义零样本设置下均实现了最先进的性能,具体提升幅度达到XX%,显著超越了现有基线方法,验证了其有效性和优越性。
🎯 应用场景
该研究的潜在应用领域包括智能监控、虚拟现实和人机交互等场景,能够在未见过的动作类别中实现高效识别,提升系统的智能化水平。未来,该技术可能推动更多基于动作识别的应用发展,尤其是在动态环境中的实时识别任务。
📄 摘要(原文)
Zero-shot skeleton-based action recognition (ZSAR) aims to recognize unseen action categories by aligning skeleton features with textual semantics. However, existing methods rely on text-derived prototypes that inherently lack geometric structure and physical constraints, resulting in a pronounced \textit{semantic-kinematic gap}. To bridge this gap, we propose \textbf{GenPrior}, the first framework to exploit generative priors from pre-trained Text-to-Motion (T2M) models for ZSAR. Specifically, we introduce Dispersion-Gated Feature Fusion, which distills kinematic prototypes and intra-class dispersion from generative motion sequences and employs a learned gating network to adaptively inject reliable structural cues into textual embeddings while suppressing synthetic artifacts. Furthermore, we propose Generative Prototype Refinement, which leverages these generation-enhanced prototypes as anchors to mine high-confidence unseen samples, calibrating class prototypes toward the true distribution and thereby unleashing strong performance gains. Extensive experiments on NTU-60, NTU-120, and PKU-MMD demonstrate that GenPrior achieves state-of-the-art performance under both zero-shot and generalized zero-shot settings. Code is available at https://github.com/jidongkuang/GenPrior.