UG-UMRE: Uncertainty-Guided Modality Augmentation and Distributional Calibration for Unified Multimodal Relation Extraction
作者: Bo Kong, Liruiz Jia, Yi Liang, Chao Liu, Dongfang Han, Tianwei Yan, Yuan Liu, Shengquan Liu
分类: cs.CV, cs.CL, cs.IT, cs.MM
发布日期: 2026-08-05
备注: Accepted at ACM MM2026
💡 一句话要点
提出UG-UMRE以解决多模态关系提取中的不确定性问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态关系提取 不确定性建模 自监督学习 高斯分布 深度学习 信息检索 特征增强
📋 核心要点
- 现有的多模态关系提取方法忽视了固有的不确定性,导致噪声传播和信息损失。
- 提出的不确定性引导的单模态增强(UDUA)模块,通过建模高斯分布来有效过滤噪声,并保持语义一致性。
- 在三个基准数据集上,UG-UMRE实现了最先进的性能,验证了其模块的有效性和可插拔性。
📝 摘要(中文)
统一多模态关系提取(UMRE)旨在识别文本实体与视觉对象之间的内模态和跨模态关系。然而,现有UMRE研究面临两个关键问题:忽视固有的随机不确定性导致噪声传播,以及不同模态分布之间的深层异质性阻碍了对齐。为了解决这些问题,本文提出了不确定性引导的UMRE网络(UG-UMRE)。具体而言,我们设计了不确定性驱动的单模态增强(UDUA)模块,该模块基于变分信息瓶颈将特征建模为高斯分布。通过结合不确定性感知的自监督对比学习机制,UDUA有效过滤噪声,同时保持语义一致性。此外,我们引入了联合随机不确定性对齐(JAUA)模块作为全局语义预校准机制,JAUA利用概率分布一致性构建共享潜在空间,通过同步跨模态统计特性消除分布差距,为细粒度交互奠定了坚实基础。实验结果表明,UG-UMRE在三个基准数据集(UMRE、MORE和MNRE)上实现了最先进的性能,进一步分析验证了UDUA和JAUA模块的可插拔性和有效性。
🔬 方法详解
问题定义:本文旨在解决统一多模态关系提取中的两个主要问题:一是固有的随机不确定性导致的噪声传播,二是不同模态间深层异质性造成的分布对齐困难。
核心思路:提出的不确定性引导的UMRE网络(UG-UMRE)通过引入不确定性驱动的单模态增强(UDUA)模块和联合随机不确定性对齐(JAUA)模块,旨在有效过滤噪声并实现跨模态的分布一致性。
技术框架:UG-UMRE的整体架构包括UDUA模块用于单模态特征增强,以及JAUA模块用于全局语义的预校准。这两个模块协同工作,确保了多模态数据的有效融合与对齐。
关键创新:UDUA模块通过变分信息瓶颈将特征建模为高斯分布,结合不确定性感知的自监督对比学习机制,显著提高了噪声过滤能力。JAUA模块则通过构建共享潜在空间,消除了模态间的分布差距。
关键设计:UDUA模块的设计包括高斯分布建模和自监督对比学习机制,JAUA模块则依赖于概率分布一致性来实现模态对齐。具体的损失函数和网络结构设计在实验中经过优化,以确保最佳性能。
🖼️ 关键图片
📊 实验亮点
在三个基准数据集(UMRE、MORE和MNRE)上,UG-UMRE实现了最先进的性能,相较于现有方法,性能提升幅度达到XX%。实验结果验证了UDUA和JAUA模块的有效性和可插拔性,显示出良好的应用前景。
🎯 应用场景
该研究的潜在应用领域包括智能搜索引擎、社交媒体内容分析和自动化图像标注等。通过有效提取多模态关系,UG-UMRE能够提升信息检索的准确性和效率,具有广泛的实际价值和未来影响。
📄 摘要(原文)
Unified Multimodal Relation Extraction (UMRE) aims to identify intra-modal and cross-modal relations between textual entities and visual objects. However, existing UMRE studies still encounter two critical issues: ignoring inherent aleatoric uncertainty causes noise propagation, and deep-seated heterogeneity between distinct modal distributions hinders alignment. To address these issues, we propose the Uncertainty-Guided UMRE Network (UG-UMRE). Specifically, we design an Uncertainty-Driven Unimodal Augmentation (UDUA) module, which models features as Gaussian distributions based on the Variational Information Bottleneck. By incorporating an uncertainty-aware self-supervised contrastive learning mechanism, UDUA effectively filters out noise while maintaining semantic consistency. Furthermore, we introduce the Joint Aleatoric Uncertainty Alignment (JAUA) module as a global semantic pre-calibration mechanism. JAUA leverages probabilistic distribution consistency to construct a shared latent space, eliminating the distributional gap by synchronizing cross-modal statistical properties, thereby laying a robust foundation for fine-grained interaction. Experiments on three benchmark datasets (UMRE, MORE, and MNRE) demonstrate that UG-UMRE achieves state-of-the-art performance. Further analysis validates the pluggable and effective performance of the proposed UDUA and JAUA modules.