UniCon-Former: Unified Convolution Transformer is All You Need for Hand Gesture Recognition
作者: Mallika Garg, Debashis Ghosh, Pyari Mohan Pradhan
分类: cs.CV, cs.HC
发布日期: 2026-08-13
💡 一句话要点
提出UniCon-Former以解决手势识别中的局部与全局特征学习问题
🎯 匹配领域: 支柱八:物理动画 (Physics-based Animation)
关键词: 手势识别 卷积神经网络 变换器 深度学习 多尺度特征 高分辨率 统一模型
📋 核心要点
- 现有的卷积神经网络在捕捉全局上下文方面存在局限性,而变换器则面临高计算成本和冗余问题。
- 本文提出的UniCon-Former模型结合了卷积神经网络和变换器的优点,能够有效学习局部和全局特征。
- 在NVGesture和Briareo数据集上的实验结果显示,UniCon-Former以更少的参数和计算量实现了最先进的性能。
📝 摘要(中文)
卷积神经网络(CNN)在捕捉局部特征方面表现出色,但由于感受野的限制,难以有效捕捉全局上下文。相对而言,变换器(transformer)通过自注意力机制能够有效捕捉全局依赖关系,但面临高冗余和计算成本的问题。为此,本文提出了一种统一模型UniCon-Former,旨在在动态手势识别中提供稳健且高效的性能。该统一方法使模型能够同时学习局部和全局特征,通过在每个变换器阶段开始时使用卷积投影来降低输入向量的维度,从而在每个变换器阶段创建金字塔结构。这些特征使UniCon-Former在资源使用上优于传统变换器,灵活地学习多尺度和高分辨率特征,满足手势识别的需求。实验结果表明,在NVGesture和Briareo数据集上,UniCon-Former以更少的参数和MACs实现了最先进的结果。
🔬 方法详解
问题定义:本文旨在解决手势识别中局部特征与全局特征学习的不足,现有的卷积神经网络难以捕捉全局上下文,而变换器则面临高计算成本的问题。
核心思路:UniCon-Former通过将卷积神经网络与变换器结合,利用卷积投影在变换器阶段降低输入维度,从而同时学习局部和全局特征。
技术框架:该模型的整体架构包括多个变换器阶段,每个阶段通过卷积投影创建金字塔结构,逐步提取多尺度特征,增强模型的灵活性和效率。
关键创新:UniCon-Former的主要创新在于其统一的卷积-变换器结构,使得模型在资源使用上优于传统变换器,能够高效处理高分辨率特征。
关键设计:模型在参数设置上进行了优化,采用了适当的损失函数和网络结构设计,以确保在减少计算量的同时保持识别精度。
🖼️ 关键图片
📊 实验亮点
在NVGesture和Briareo数据集上的实验结果显示,UniCon-Former以更少的参数和计算量(MACs)实现了最先进的性能,展示了其在手势识别任务中的有效性和高效性。
🎯 应用场景
该研究的潜在应用领域包括人机交互、虚拟现实和增强现实等场景,能够提升手势识别的准确性和实时性,具有广泛的实际价值和未来影响。
📄 摘要(原文)
Convolutional Neural Networks (CNNs) capture local features efficiently but struggle with global context due to their limited receptive field. On the other hand, transformers effectively capture global dependencies through self-attention but suffer from high redundancy and computational costs. Thus, to leverage the advantages of both CNNs and transformers, we propose a unified model (UniCon-Former) that aims to provide robust and efficient performance on dynamic hand gesture recognition. The unified approach helps the model to learn both local and global features. At the beginning of each transformer stage, the convolution projections help in decreasing the dimension of the input vectors of the transformer block. This creates a pyramidal structure at each transformer stage. These features enable the UniCon-Former to reduce resource usage than vanilla transformers, making it flexible for learning multi-scale and high-resolution features, which is required in hand gesture recognition. We have performed experiments with NVGesture and Briareo datasets and achieved state-of-the-art results with fewer parameters and MACs.