Mitigating Strong-Modality Collapse in Multimodal Learning via Inverted Asymmetric Fusion
作者: Mary Ogbuka Kenneth, Foaad Khosmood, Abbas Edalat
分类: cs.LG, cs.MM
发布日期: 2026-08-27
💡 一句话要点
提出反向非对称融合以解决多模态学习中的强模态崩溃问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱五:交互与反应 (Interaction & Reaction) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态学习 强模态崩溃 反向非对称融合 模态感知知识蒸馏 性能提升 计算机视觉 自然语言处理
📋 核心要点
- 现有的多模态融合方法在某些情况下无法超越单模态基线,尤其是在主导模态的准确性下降时。
- 论文提出的反向非对称融合(IAF)方法通过不强制模态间的相互注意来保护主导模态的完整性。
- 实验结果表明,IAF在多个基准数据集上显著提高了模型性能,尤其是在文本主导和音频视觉主导的数据集上。
📝 摘要(中文)
多模态融合旨在提升模型性能,但在MultiHuSE数据集上,早期、晚期和对称注意力融合常常无法超越最佳的单模态基线(文本)。对称注意力融合模型的路径隔离显示,文本路径的准确率在融合后从74.9%降至56.4%,表明主导模态在融合过程中可能会退化。我们称之为强模态崩溃,并认为这解释了某些多模态模型未能超越单模态基线的原因。我们提出了反向非对称融合(IAF),避免强制模态间的相互注意,主导模态通过融合保持不变,而较弱模态则作为上下文锚点进行关注。通过在三个具有不同模态层次的基准上评估IAF,结果显示IAF在所有测试配置中保持了主导模态的内部准确率,而对称融合则在MultiHuSE上降低了高达18.5%。IAF在最强单模态基线上的提升幅度可达8.25%。
🔬 方法详解
问题定义:论文要解决的问题是多模态融合中强模态崩溃现象,即主导模态在融合过程中准确性下降,导致整体性能不佳。现有的对称注意力融合方法在这一点上表现不佳,无法有效保护主导模态的性能。
核心思路:论文的核心思路是提出反向非对称融合(IAF),该方法通过不强制模态间的相互注意,保持主导模态不变,同时让较弱模态围绕主导模态进行上下文关注,从而避免强模态崩溃。
技术框架:IAF的整体架构包括两个主要阶段:首先,通过模态感知知识蒸馏增强较弱模态的特征;其次,在融合阶段,主导模态保持不变,较弱模态则基于主导模态进行调整。
关键创新:最重要的技术创新点在于反向非对称融合的设计,它与传统的对称融合方法本质上不同,后者往往导致主导模态的性能下降,而IAF则有效地保护了主导模态的准确性。
关键设计:在IAF中,采用了模态感知知识蒸馏来增强较弱模态的特征,同时在融合过程中保持主导模态的原始特征不变,确保其在融合后的准确性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,反向非对称融合(IAF)在多个基准数据集上显著提升了模型性能,尤其是在文本主导的MultiHuSE和UR-FUNNY数据集上,IAF相较于最强单模态基线提升幅度可达8.25%。同时,IAF在MultiHuSE数据集上保持了主导模态的准确性,而对称融合则降低了高达18.5%。
🎯 应用场景
该研究的潜在应用领域包括自然语言处理、计算机视觉和多模态情感分析等。通过有效的多模态融合技术,能够提升模型在复杂任务中的表现,具有重要的实际价值和广泛的应用前景,尤其是在需要综合多种信息源的场景中。
📄 摘要(原文)
Fusing multiple modalities is expected to improve model performance. However, on the MultiHuSE dataset, early, late, and symmetric attention fusion often fail to outperform the best unimodal baseline (text). Pathway isolation of a symmetric attention fusion model reveals that the text-pathway accuracy drops from 74.9% to 56.4% after fusion in one such setting, indicating that the dominant modality can be degraded during integration. We term this strong-modality collapse and argue that it helps explain why some multimodal models fail to surpass unimodal baselines. We propose Inverted Asymmetric Fusion (IAF), which avoids forcing mutual attention across modalities. The dominant modality is preserved by passing through fusion unchanged, while weaker modalities attend to it as a contextual anchor. Before fusion, weaker modalities are strengthened using Modality-Aware Knowledge Distillation. We evaluate IAF on three benchmarks with different modality hierarchies: text-dominant datasets (MultiHuSE, UR-FUNNY) and an audio-visual-dominant dataset (MUStARD). Pathway isolation shows that IAF preserves the dominant modality's internal accuracy at its unimodal ceiling across all tested configurations, whereas symmetric fusion degrades it by up to 18.5% on MultiHuSE. IAF improves over the strongest unimodal baseline by up to 8.25%.