EmotionDialogCN: A Spontaneous Multimodal Dataset for Mandarin Emotional Dialogue

📄 arXiv: 2608.20905v1 📥 PDF

作者: Yi Zheng, Yifan Xu, Yan Zhou, Hejia Chen, Chunyu Qiang, Xiaoqiang Liu, Xiaohan Li, Shenze Huang, Yue Zhang, Guoying Zhao, Pengfei Wan

分类: cs.CV

发布日期: 2026-08-21


💡 一句话要点

提出EmotionDialogCN以解决多模态对话数据集情感标注不足问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态对话 情感分析 数据集构建 自然语言处理 人机交互 情感计算 社交机器人

📋 核心要点

  1. 现有多模态对话数据集在情感标注、情感多样性和规模上存在显著不足,限制了情感分析和对话系统的研究。
  2. 本文提出EmotionDialogCN数据集,通过新颖的数据收集框架,捕捉自然的情感表达,解决了现有数据集的局限性。
  3. EmotionDialogCN在情感分布偏差上显著优于以往数据集,且在多模态融合性能上表现出强大的对齐和互补性。

📝 摘要(中文)

面对面视听互动是人类沟通的核心,传达丰富的情感和社会线索。然而,现有的多模态对话数据集在情感标注、情感多样性和规模上存在不足。为此,本文介绍了EmotionDialogCN,这是一个大规模的视听情感数据集,旨在捕捉真实的面对面交流。该数据集包含119名专业演员在20个日常场景中表演的21,880个对话会话,涵盖18种情感类别,录音时长超过400小时,是同类数据集中规模最大、内容最全面的。新颖的数据收集框架最大限度地减少了设备干扰,使情感表达自然细腻。EmotionDialogCN的情感分布偏差为0.64,远低于以往数据集的5.65,且在声学、词汇和视觉模态上表现出稳定的单模态和多模态性能,融合结果进一步强调了强大的多模态对齐和跨模态互补性。

🔬 方法详解

问题定义:现有多模态对话数据集在情感标注的准确性、情感多样性和数据规模上存在不足,导致情感分析和对话系统的研究受到限制。

核心思路:本文通过构建EmotionDialogCN数据集,采用新颖的数据收集框架,旨在捕捉真实的面对面情感交流,提升情感表达的自然性和多样性。

技术框架:数据集的构建包括多个阶段:首先招募119名专业演员,设计20个日常场景;其次进行对话录制,确保情感表达的真实性;最后进行情感标注和数据整理。

关键创新:EmotionDialogCN是目前规模最大、情感类别最全面的多模态数据集,其情感分布偏差显著低于以往数据集,体现了更高的情感表达真实性。

关键设计:在数据收集过程中,采用了减少设备干扰的技术,确保情感表达的自然流畅;同时,数据集涵盖18种情感类别,录音时长超过400小时,提供了丰富的训练和测试数据。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

EmotionDialogCN在情感分布偏差上达到了0.64,显著优于以往数据集的5.65,显示出更高的情感表达真实性。此外,该数据集在声学、词汇和视觉模态上表现出稳定的单模态和多模态性能,融合结果进一步强调了强大的多模态对齐和跨模态互补性。

🎯 应用场景

EmotionDialogCN数据集具有广泛的应用潜力,尤其在情感分析、对话系统、社交机器人和人机交互等领域。通过提供高质量的多模态数据,该数据集能够推动情感计算和自然语言处理技术的发展,提升智能系统的情感理解能力和交互质量。未来,该数据集可能成为相关研究的标准基准,促进学术界和工业界的合作与创新。

📄 摘要(原文)

Face-to-face audiovisual interaction is central to human communication, conveying rich emotional and social cues. However, existing multimodal dialogue datasets remain limited by inadequate emotion annotations, poor emotional diversity, and small scale. We introduce EmotionDialogCN, a large-scale audiovisual-emotional dataset designed to capture authentic face-to-face communication. It contains 21,880 dialogue sessions performed by 119 professional actors across 20 everyday scenarios, covering 18 emotion categories with over 400 hours of recordings, the largest and most comprehensive dataset of its kind. A novel data collection framework minimizes equipment interference, enabling natural and nuanced emotional expressions. EmotionDialogCN achieves an emotion distribution deviation of 0.64 from real human emotion statistics (versus 5.65 for prior datasets) and consistent subject framing (52-59% frame occupancy). Together, these properties translate into stable unimodal and multimodal performance across acoustic, lexical, and visual modalities, with fusion results further underscoring strong multimodal alignment and cross-modal complementarity.