A Browser-Based Gesture-Driven Avatar Interaction Framework for Metaverse Onboarding Environments
作者: Deepti Parachuri, Chhayank Sahu, Sameer Singh Choudhary
分类: cs.HC, cs.GR
发布日期: 2026-08-12
备注: 6 pages, 4 figures, 2 tables
💡 一句话要点
提出基于手势驱动的虚拟化身交互框架以改善元宇宙入门体验
🎯 匹配领域: 支柱一:机器人控制 (Robot Control)
关键词: 手势识别 虚拟化身 元宇宙 自然交互 无控制器交互 实时反馈 用户体验
📋 核心要点
- 现有的元宇宙交互方式多依赖控制器,限制了用户的自然交互体验,导致沉浸感不足。
- 本文提出了一种基于手势的交互框架,用户可以通过手、臂和头部手势与虚拟环境进行交互,消除了对控制器的依赖。
- 通过对五名参与者的实验评估,系统在用户体验和交互自然性方面表现出显著提升,提供了有效的设计反馈。
📝 摘要(中文)
虚拟化身交互影响元宇宙体验的沉浸感和参与感。为实现自然交互,本文提出了一种基于手势的交互层,用户可通过手、臂和头部手势在浏览器中探索虚拟房间,替代传统的键盘或控制器。该系统结合了实时手势识别技术(Google MediaPipe)和两种替代的移动技术,用户可根据任务需求在精确度与身体沉浸感之间进行权衡。本文的贡献在于将这些技术整合、部署并评估为一个轻量级、可在网页上部署的无控制器交互模型,并通过五名参与者的结构化内部入门会话进行了评估,报告了有效性、无效性及设计权衡。
🔬 方法详解
问题定义:本文旨在解决传统控制器依赖的虚拟交互方式带来的沉浸感不足问题。现有方法往往限制了用户的自然交互,导致体验不佳。
核心思路:论文提出了一种基于手势的交互模型,允许用户通过自然的手、臂和头部动作与虚拟环境进行交互,从而提升沉浸感和参与度。设计的核心在于消除对控制器的依赖,使交互更加直观和自然。
技术框架:该系统的整体架构包括实时手势识别模块(使用Google MediaPipe)、两种移动技术(手举导航和原地行走),用户可以根据任务需求选择合适的交互方式。
关键创新:最重要的创新在于将手势识别与多种移动技术结合,形成一个轻量级的、无控制器的交互模型。这种整合使得用户能够在不同的交互场景中灵活选择,提高了交互的灵活性和自然性。
关键设计:系统在手势识别的准确性和响应速度上进行了优化,确保用户的动作能够实时反馈到虚拟环境中。此外,移动技术的选择也考虑了用户的物理空间和任务需求,提供了多样化的交互体验。
🖼️ 关键图片
📊 实验亮点
实验结果显示,参与者在使用该手势驱动交互系统时,沉浸感和参与度显著提高。与传统控制器交互方式相比,用户在任务完成效率和满意度上均有明显提升,具体数据尚未披露。
🎯 应用场景
该研究的潜在应用领域包括教育、培训和虚拟会议等元宇宙环境。通过自然的手势交互,用户能够更好地参与到虚拟活动中,提升学习和交流的效果。未来,该技术还可以扩展到更多的虚拟现实和增强现实场景,推动人机交互的进一步发展。
📄 摘要(原文)
Avatar interaction shapes how engaging and immersive a metaverse experience feels, and for that interaction to feel natural, avatars need to respond to users without forcing them through a controller-based interface first. This paper describes a gesture-driven interaction layer built for a browser-based metaverse onboarding environment, where users explore a set of virtual rooms as an avatar and interact with embedded video, document, and quiz content using hand, arm, and head gestures instead of a keyboard or controller. The system combines real-time gesture recognition (Google MediaPipe) with two alternative locomotion techniques - hand-raise navigation and in-place walking - so users can trade off precision against physical immersion depending on the task. The contribution is the integration, deployment, and evaluation of these techniques as a single lightweight, web-deployable, controller-free interaction model, assessed through a structured internal onboarding session with five participants. We report what worked, what didn't, and the design trade-offs that came out of combining these techniques in one deployed system.