Sign Language Recognition Using Original and Synthetic Depth Image Based Point Cloud Data Models
作者: Rustem Ozakar, Eyup Gedikli
分类: cs.CV, cs.AI
发布日期: 2026-08-10
💡 一句话要点
提出基于深度图像的点云数据模型以提升手语识别性能
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)
关键词: 手语识别 深度图像 点云数据 合成图像 神经网络 PointNet 机器学习
📋 核心要点
- 现有手语识别方法主要依赖RGB图像,缺乏深度图像数据集,限制了模型的性能提升。
- 本文提出通过Depth Anything V2网络从RGB图像生成合成深度图像,并结合多种PointNet架构进行手语识别。
- 实验结果表明,原始深度点云模型在大多数情况下优于合成模型,但在特定模型中合成模型表现更佳。
📝 摘要(中文)
手语识别研究主要依赖RGB图像,而提供深度图像的数据集相对有限。本文利用深度图像生成网络Depth Anything V2,从RGB图像合成合成深度图像,并结合三种手语数据集(Real-time ASL Fingerspelling、KArSL、AUTSL)进行实验。通过不同的PointNet架构对原始和合成深度图像生成的点云数据进行分类,结果显示大多数模型在手语识别中都取得了可接受的性能。总体而言,基于原始深度的点云模型表现优于合成模型,但在某些模型中,合成深度模型的表现更佳。
🔬 方法详解
问题定义:本文旨在解决手语识别中对深度图像数据集的依赖不足的问题,现有方法主要依赖RGB图像,导致识别性能受限。
核心思路:通过Depth Anything V2网络从RGB图像生成合成深度图像,利用这些合成图像与原始深度图像生成的点云数据进行手语识别,提升模型的准确性和鲁棒性。
技术框架:研究使用三种手语数据集进行实验,分别是Real-time ASL Fingerspelling、KArSL和AUTSL。通过不同的PointNet架构对生成的点云数据进行分类,比较原始与合成深度图像的性能。
关键创新:最重要的创新在于使用合成深度图像进行手语识别,这在现有研究中较为少见,且通过对比分析展示了合成图像的潜在价值。
关键设计:在实验中,采用了多种PointNet架构进行分类,评估了不同模型的性能,关键参数和损失函数的设置经过精心调整,以确保模型的有效性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,基于原始深度图像的点云模型在大多数情况下优于合成模型,但在某些特定模型中,合成深度图像的表现更佳。整体分类准确率在不同模型中均达到了可接受的水平,展示了合成深度图像在手语识别中的潜力。
🎯 应用场景
该研究的潜在应用领域包括手语翻译、无障碍沟通工具以及智能人机交互系统。通过提升手语识别的准确性,可以帮助听障人士更好地与社会沟通,具有重要的社会价值和实际意义。未来,该技术还可以扩展到其他领域,如虚拟现实和增强现实中的手势识别。
📄 摘要(原文)
Research regarding the sign language recognition mostly relies on RGB images, whileas sign language datasets that provide depth images are limited. Point clouds obtained from depth images can be used for sign language recognition with neural networks like PointNet. In recent years, various neural networks are used for generating realistic depth images from monocular RGB images. In this work, synthetic depth images were created from RGB images using Depth Anything V2 network. For this purpose, three sign language datasets (Real-time ASL Fingerspelling, KArSL, AUTSL) which contain both RGB and depth images were used. Classification accuracies of the point cloud data created from both original and synthetic depth images using various PointNet architectures were measured for sign language recognition. From the original and synthetic point clouds, frame based, Point Gesture Map and Long Short Term Memory data models were used for classification and their performances were compared. In the results, both original and synthetic based data achieved acceptable performance in most models. In general, original depth based point cloud models performed better than synthetic ones, however in some models synthetic depth based models performed better than the originals.