Rationale-Guided Learning for Multimodal Emotion Recognition
作者: Sujung Oh, Jung Uk Kim, Sangmin Lee
分类: cs.AI
发布日期: 2026-08-11
备注: ICASSP 2026
期刊: S. Oh, J. U. Kim and S. Lee, "Rationale-Guided Learning for Multimodal Emotion Recognition," ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), Barcelona, Spain, 2026, pp. 12577-12581
DOI: 10.1109/ICASSP55912.2026.11464500
💡 一句话要点
提出基于理由引导学习的多模态情感识别方法
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态情感识别 理由引导学习 因果推理 大型语言模型 情感计算
📋 核心要点
- 现有的多模态情感识别方法往往忽视了人类在解读情感时的因果推理,导致性能不足。
- 本文提出的理由引导学习框架通过将情感推理分解为多个方面,结合大型语言模型生成结构化理由,提升了模型的推理能力。
- 实验结果显示,RGL在IEMOCAP和MELD基准测试中表现优异,且模型能够有效提取未见样本的语义合理理由。
📝 摘要(中文)
多模态情感识别在对话中需要理解言语和非言语线索之间的复杂互动。然而,现有方法通常将其视为直接的输入输出映射问题,忽视了人类在解读情感时使用的因果推理。本文提出了一种新颖的理由引导学习框架,将多模态情感识别转化为一种受认知启发的推理任务。基于双重过程理论,我们将情感推理分解为直观、情境和综合三个方面。我们利用大型语言模型生成结构化的理由,并将其编码为记忆,以指导模型训练,使内部表示与人类推理模式对齐。实验结果表明,RGL在IEMOCAP和MELD基准上达到了最先进的性能。
🔬 方法详解
问题定义:本文旨在解决多模态情感识别中的因果推理不足问题。现有方法通常将情感识别视为简单的输入输出映射,未能有效捕捉情感的复杂性和多样性。
核心思路:论文提出的理由引导学习框架(RGL)基于双重过程理论,将情感推理分解为直观、情境和综合三个方面,借助大型语言模型生成结构化的理由,提升模型的推理能力。
技术框架:RGL的整体架构包括三个主要模块:情感推理的三个方面(直观、情境、综合),大型语言模型生成的结构化理由,以及用于模型训练的记忆编码机制。
关键创新:RGL的核心创新在于将情感识别转化为认知启发的推理任务,利用大型语言模型生成的理由来指导模型训练,从而实现与人类推理模式的对齐。
关键设计:在模型设计中,采用了特定的损失函数来优化模型的推理能力,并通过记忆机制存储生成的理由,以便在推理阶段进行有效的检索和应用。具体的网络结构和参数设置在实验中经过调优,以确保最佳性能。
🖼️ 关键图片
📊 实验亮点
实验结果表明,RGL在IEMOCAP和MELD基准测试中达到了最先进的性能,具体提升幅度超过了现有方法的基线,验证了模型在推理能力和情感理解上的有效性。
🎯 应用场景
该研究在情感计算、社交机器人和人机交互等领域具有广泛的应用潜力。通过提升情感识别的准确性,RGL可以帮助开发更具人性化的智能助手和情感交互系统,进而改善用户体验和情感理解。未来,该方法还可能扩展到其他多模态学习任务中。
📄 摘要(原文)
Multimodal emotion recognition in conversation (MERC) requires understanding complex interactions between verbal and non-verbal cues. However, most existing approaches fundamentally treat this as a direct input-output (multimodal cues-emotion labels) mapping problem, overlooking the causal reasoning that humans use when interpreting emotions. We propose rationale-guided learning (RGL), a novel framework that transforms MERC into a cognitively-inspired reasoning task. Based on dual-process theory, we decompose emotional reasoning into three facets: Intuitive (immediate perception, System 1), Contextual (situational analysis, System 2), and Integrative (synthesis of both). We leverage an MLLM offline to generate structured rationales, which are encoded as memories to guide model training via aligning internal representations with human-like reasoning patterns. Our final model operates without any MLLM overheads at inference time. Experimental results show that RGL achieves state-of-the-art performance on the IEMOCAP and MELD benchmarks. Further, for interpretation, we demonstrate that the model's internal features effectively retrieve semantically correct rationales for unseen test samples, validating its rationale reasoning capabilities.