Occlusion-Robust Multimodal Emotion Recognition in VR via Fusion of Facial Images and EMG
作者: Birgit Nierula, Karam Tomotaki-Dawoud, Mert Akguel, Mustafa Tevfik Lafci, David Przewozny, Anna Hilsmann, Peter Eisert, Sebastian Bosse
分类: cs.CV, cs.HC
发布日期: 2026-09-03
备注: Joint Proceedings of the ACM Intelligent User Interfaces (IUI) Workshops 2026
💡 一句话要点
提出多模态情感识别方法以解决VR中面部遮挡问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态情感识别 虚拟现实 肌电图 面部表情分析 情感分类 深度学习 数据集构建
📋 核心要点
- 现有的情感识别方法在VR中受到HMD遮挡的限制,无法有效分析上半部分面部表情。
- 本文提出通过融合下半部分面部视频与上半部分EMG信号来解决这一问题,从而实现情感分类。
- 实验结果显示,所提方法在情感识别上取得了51%的宏观F1分数,显著优于传统的单一模态方法。
📝 摘要(中文)
头戴显示器(HMD)在虚拟现实(VR)中限制了情感识别,因为它遮挡了上半部分面部,导致传统的基于图像的面部表情分析不完整。本文通过融合下半部分面部视频与上半部分面部的肌电图(EMG),提出了一种新的情感分类方法,能够识别七种情感类别(六种基本情感加中性)。我们构建了一个同步的多模态数据集,包含20名参与者的下半部分面部视频与七通道上半部分EMG。实验结果表明,所提出的晚期融合架构在无关受试者测试中实现了51%的宏观F1分数,优于仅使用图像(41%)和仅使用EMG(43%)的基线。这一研究为自然VR环境中的多模态情感识别奠定了基础,并促进了情感适应性应用的发展。
🔬 方法详解
问题定义:本文旨在解决在虚拟现实中由于头戴显示器遮挡上半部分面部而导致的情感识别困难。现有方法主要依赖于图像分析,无法充分利用上半部分面部的情感信息。
核心思路:通过将下半部分面部视频与上半部分的肌电图(EMG)信号进行融合,本文提出了一种新的情感分类方法,旨在利用EMG提供的补充信息来提高情感识别的准确性。
技术框架:研究采用了一种晚期融合的架构,首先提取下半部分面部视频的卷积视觉嵌入,然后将其与上半部分EMG的RBF核表示进行融合,最终进行情感分类。
关键创新:最重要的创新在于将EMG信号与视觉信息结合,克服了HMD导致的视觉遮挡问题,提供了更为全面的情感识别能力。
关键设计:在实验中,采用了七通道的EMG信号,并设计了特定的损失函数以优化多模态融合效果,确保了模型在不同情感类别上的表现。实验结果显示,所提方法在宏观F1分数上达到了51%。
🖼️ 关键图片
📊 实验亮点
实验结果表明,所提出的多模态融合方法在无关受试者测试中实现了51%的宏观F1分数,显著高于仅使用图像和EMG的基线(41%和43%),展示了EMG在HMD遮挡情况下的有效性和补充性。
🎯 应用场景
该研究的潜在应用领域包括情感适应性应用,如沟通训练和治疗干预等。在虚拟现实环境中,能够实时识别用户情感状态将有助于提升用户体验和交互质量,推动相关领域的发展。
📄 摘要(原文)
Head-mounted displays (HMDs) fundamentally limit emotion recognition in virtual reality (VR): by occluding the upper face, they render conventional image-based facial expression analysis incomplete, particularly for applications requiring real-time affective assessment. We address this challenge by fusing lower-face video with facial electromyography (EMG) from the occluded upper face to classify seven emotional categories (six basic emotions plus neutral). We introduce a synchronized multimodal dataset from 20 participants, pairing lower-face video with seven-channel upper-face EMG elicited by validated emotion stimuli. Under subject-independent test, our proposed late-fusion architecture merging convolutional visual embeddings with RBF-kernel EMG representations achieves 51% macro-F1, outperforming both image-only (41%) and EMG-only (43%) baselines. These results demonstrate that upper-face EMG provides robust complementary information under HMD-induced visual occlusion and establish a foundation for multimodal emotion recognition in naturalistic VR environments. This approach facilitates affect-adaptive applications, including communication training and therapeutic interventions. The dataset will be shared upon request under an ethical-use agreement.