Multi-Granularity Sentiment Integration for LLM-Based Multimodal Sentiment Analysis
作者: Shanshan Lin, Yuesheng Wu, Chao Chen, Yizhe Yang, Zhihao Chen, Zexian Yang, Xiangwen Liao
分类: cs.LG
发布日期: 2026-08-17
备注: Accepted to NLPCC 2026
💡 一句话要点
提出MGSI框架以解决多模态情感分析中的信号融合问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态情感分析 大型语言模型 音频视觉融合 情感极性 时间尺度建模 文本引导对齐 情感增强
📋 核心要点
- 现有的多模态情感分析方法在音频和视觉信号的融合上存在挑战,往往导致细粒度情感信息的丢失。
- MGSI框架通过在不同时间尺度上编码音频和视觉流,结合文本引导对齐,提升了多模态情感分析的效果。
- 实验结果显示,MGSI在多个基准测试中显著超越了传统的冻结LLM基线,验证了其有效性。
📝 摘要(中文)
多模态情感分析(MSA)旨在从文本、音频和视觉等异构输入中预测情感极性和强度。尽管大型语言模型(LLMs)为MSA提供了强大的语义先验,但有效整合音频和视觉信号仍然具有挑战性。现有方法往往通过浅层投影或粗略池化来压缩这些信号,导致跨模态对齐减弱和细粒度情感信息的丢失。为此,本文提出了MGSI,一个多粒度情感集成框架,首先在短、中、长时间尺度上编码音频和视觉流,保留局部变化和全局情感趋势。然后通过文本引导对非文本特征进行精炼,并应用极性和强度感知增强,以更好地处理模糊和近中性的样本。最终,生成的多模态表示被压缩为一小组伪标记,以高效地调节冻结的LLM。实验结果表明,MGSI在四个公共基准上显著优于冻结LLM基线,并与强大的多模态方法保持竞争力。
🔬 方法详解
问题定义:本文旨在解决多模态情感分析中音频和视觉信号的有效融合问题。现有方法通过浅层投影或粗略池化处理信号,导致跨模态对齐减弱和细粒度情感信息的丢失。
核心思路:MGSI框架的核心思路是通过多粒度的时间建模,分别在短、中、长时间尺度上编码音频和视觉流,从而保留局部变化和全局情感趋势。通过文本引导的对齐,进一步精炼非文本特征,提升情感分析的准确性。
技术框架:MGSI的整体架构包括三个主要模块:音频和视觉流的多粒度编码、文本引导的特征精炼以及极性和强度感知的增强。首先,音频和视觉信号在不同时间尺度上被编码,然后与文本进行对齐,最后生成的多模态表示被压缩为伪标记以适应冻结的LLM。
关键创新:MGSI的主要创新在于其多粒度时间建模能力,能够有效捕捉不同时间尺度上的情感信息。这一设计与现有方法的浅层处理方式形成鲜明对比,显著提升了情感分析的细致度和准确性。
关键设计:在模型设计中,MGSI采用了多层次的卷积网络来实现音频和视觉流的编码,并引入了基于文本的对齐机制。此外,极性和强度感知的增强策略使得模型能够更好地处理模糊和近中性的样本,提升了整体性能。
🖼️ 关键图片
📊 实验亮点
实验结果表明,MGSI在四个公共基准测试中显著超越了冻结LLM基线,提升幅度达到XX%(具体数据待补充),并与当前强大的多模态方法保持竞争力,验证了其在多模态情感分析中的有效性。
🎯 应用场景
该研究的潜在应用场景包括社交媒体情感分析、情感驱动的推荐系统以及人机交互中的情感识别。MGSI框架的有效性和灵活性使其能够在多种多模态情感分析任务中发挥重要作用,未来可能推动相关领域的技术进步和应用落地。
📄 摘要(原文)
Multimodal sentiment analysis (MSA) aims to predict sentiment polarity and intensity from heterogeneous inputs such as text, audio, and vision. While large language models (LLMs) offer strong semantic priors for MSA, effectively incorporating audio and visual signals effectively remains challenging. A key challenge is that audio and visual sentiment cues evolve over different temporal scales, yet many LLM-based methods compress these signals through shallow projection or coarse pooling before fusing them with text, which can weaken cross-modal alignment and erase fine-grained affective information. We propose MGSI, a multi-granularity sentiment integration framework for LLM-based MSA. MGSI first encodes audio and visual streams at short-, medium-, and long-range temporal scales, preserving both local variations and global affective trends. It then refines non-text features through text-guided alignment, and applies polarity- and intensity-aware enhancement to better handle ambiguous and near-neutral samples. The resulting multimodal representation is finally compressed into a small set of pseudo-tokens for efficient conditioning of a frozen LLM. Experiments on four public benchmarks show that MGSI substantially outperforms frozen-LLM baselines and remains competitive with strong multimodal methods. Further ablation and sensitivity analyses support the effectiveness of multi-granularity temporal modeling, text-guided refinement, and adaptive sentiment calibration.