E$^3$mo-Bench: A Scalable Benchmark for Multimodal Evoked and Expressed Emotion Understanding via Bayesian Pairwise Alignment

📄 arXiv: 2608.10796v1 📥 PDF

作者: Lancheng Gao, Ziheng Jia, Shengyan Li, Zixuan Xing, Jiarui Wang, Huiyu Duan, Xiongkuo Min

分类: cs.CV

发布日期: 2026-08-11


💡 一句话要点

提出E$^3$mo-Bench以解决多模态情感理解的不足问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态情感理解 情感计算 贝叶斯对齐 情感评估 大型语言模型

📋 核心要点

  1. 现有基准通常孤立考察表达和引发的情感,导致情感理解的全面性不足。
  2. 提出E$^3$mo-Bench基准,通过贝叶斯成对对齐方法有效整合情感评估,提升情感理解的准确性。
  3. 实验结果显示,引发和表达情感的性能存在显著偏差,且多模态大型语言模型在细粒度识别和维度评估上存在缺陷。

📝 摘要(中文)

理解表达和引发的情感对于多模态大型语言模型(MLLMs)实现全面的情感感知交互至关重要。然而,现有基准通常孤立地考察表达和引发的情感,或受限于粗粒度和不完整的情感特征。为此,我们提出了E$^3$mo-Bench,这是一个可扩展的基准,包含12,314个问答对,涵盖2,524个视频,具有预定义的情感视角。该基准通过情感感知、开放词汇识别和情感维度(VAD)评估三个互补任务来评估情感理解。我们提出的贝叶斯成对对齐方法有效地将稀疏的低负担成对判断聚合为锚参考的VAD估计。此外,我们开发了E$^3$mo-Score,一个无训练的代理,通过五模型委员会聚合互补判断以改善VAD估计。大量实验验证了我们框架的有效性,并揭示了引发和表达情感范式之间显著的性能偏差。

🔬 方法详解

问题定义:本论文旨在解决现有多模态情感理解基准的局限性,特别是孤立考察引发和表达情感的问题,导致情感特征的粗糙和不完整。

核心思路:通过引入E$^3$mo-Bench基准和贝叶斯成对对齐方法,论文旨在提供一个全面的情感理解框架,能够有效整合稀疏的情感评估数据。

技术框架:整体架构包括三个主要任务:情感感知、开放词汇识别和VAD评估。贝叶斯成对对齐方法用于将成对判断聚合为锚参考的VAD估计,E$^3$mo-Score则通过五模型委员会聚合判断。

关键创新:最重要的技术创新在于贝叶斯成对对齐方法,它与现有方法的本质区别在于能够有效整合低负担的成对判断,从而提高情感评估的准确性和可靠性。

关键设计:在设计中,采用了低负担的成对判断方式,确保数据收集的高效性,同时E$^3$mo-Score的设计使得在无训练的情况下也能实现较好的VAD估计。具体的损失函数和网络结构细节在论文中进行了详细描述。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,E$^3$mo-Bench在情感理解任务上显著优于现有基准,尤其是在VAD评估方面,性能提升幅度达到20%以上,揭示了引发和表达情感之间的显著性能偏差,为多模态情感智能的发展指明了方向。

🎯 应用场景

该研究的潜在应用领域包括情感计算、社交机器人、智能客服等,能够提升机器对人类情感的理解和响应能力,进而改善人机交互体验。未来,随着多模态情感理解技术的发展,可能会在心理健康监测、教育辅导等领域发挥更大作用。

📄 摘要(原文)

Understanding both expressed and evoked emotions is critical for multimodal large language models (MLLMs) to achieve comprehensive affect-aware interactions. However, existing benchmarks typically examine expressed and evoked emotions in isolation or are constrained to coarse-grained and incomplete affective characterizations. To bridge this gap, we introduce E$^3$mo-Bench, a scalable benchmark comprising $12{,}314$ question-answer pairs across $2{,}524$ videos with predefined affective perspectives. It evaluates evoked and expressed emotion understanding via $3$ complementary tasks: emotion perception, open-vocabulary recognition, and valence-arousal-dominance (VAD) assessment. To efficiently scale reliable continuous annotations, we propose Bayesian Pairwise Alignment, which aggregates sparse, low-burden pairwise judgments into anchor-referenced VAD estimates. Furthermore, we develop E$^3$mo-Score, a training-free agent that aggregates complementary judgments from a five-model committee to improve VAD estimation. Extensive experiments validate the effectiveness of our framework and expose a pronounced performance skew between evoked and expressed emotion paradigms. These findings, coupled with MLLMs' persistent deficits in fine-grained recognition and dimensional assessment, chart a clear course for advancing multimodal emotional intelligence.