GAUGE: Granularity-Adaptive Counterfactual Gating of Evidence for Incomplete Multimodal Classification
作者: Yunping Shi, En Yu, Kairui Guo, Jie Lu
分类: cs.LG, cs.AI
发布日期: 2026-08-06
💡 一句话要点
提出GAUGE以解决多模态分类中的不完整性问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态分类 反事实门控 泰勒证据分数 证据调制 模态不完整性
📋 核心要点
- 现有多模态分类方法假设所有模态均可用,缺乏对不完整输入的有效处理,导致预测可靠性下降。
- GAUGE通过细粒度证据单元和反事实门控机制,动态调整输入证据,提升了对模态不完整性的适应能力。
- 在六个基准测试中,GAUGE在多种不完整输入设置下表现优异,超越了多个强基线,验证了其有效性。
📝 摘要(中文)
多模态分类通常假设所有模态均可用,但现实输入往往不完整。现有的插补和动态融合方法在粗粒度模态层面操作,无法有效保留可靠成分并抑制误导成分,从而影响预测的可靠性。为了解决这一问题,本文提出了GAUGE,一个轻量级的反事实门控框架,用于不完整的多模态分类。GAUGE首先使用冻结的插补器对缺失模态进行插补,并将观察到的和恢复的输入统一编码为细粒度证据单元。GAUGE通过预测感知的泰勒证据分数对每个单元的反事实效应进行评分,并在单次前向-反向传播中获得这些分数。这些分数被映射为连续门控,转化为单元证据调制的加性注意力-logit偏置,而无需改变主干架构。实验表明,GAUGE在多种不完整输入设置下超越了强基线。
🔬 方法详解
问题定义:本文旨在解决多模态分类中由于模态不完整导致的预测可靠性问题。现有方法在处理缺失模态时,往往在粗粒度层面操作,无法有效区分可靠与误导的信息。
核心思路:GAUGE的核心思路是通过细粒度的证据单元和反事实门控机制,动态调整输入证据,从而提升对模态不完整性的适应能力。该方法通过预测感知的泰勒证据分数来评估每个证据单元的贡献,进而进行有效的证据调制。
技术框架:GAUGE的整体架构包括三个主要模块:首先,使用冻结的插补器对缺失模态进行插补;其次,将观察到的和恢复的输入统一编码为细粒度证据单元;最后,通过反事实门控机制对每个单元进行评分和调制,生成加性注意力-logit偏置。
关键创新:GAUGE的主要创新在于引入了反事实门控机制和预测感知的泰勒证据分数,这使得模型能够在单次前向-反向传播中高效地评估和调制证据单元,显著提升了对模态不完整性的处理能力。
关键设计:GAUGE的设计中,冻结的插补器用于处理缺失模态,泰勒证据分数用于评估每个证据单元的反事实效应,最终通过连续门控实现证据的动态调制,确保了模型的高效性与准确性。
🖼️ 关键图片
📊 实验亮点
在六个基准测试中,GAUGE在多种不完整输入设置下超越了多个强基线,展现出显著的性能提升,具体提升幅度达到X%(具体数据待补充),验证了其在不完整多模态分类中的有效性。
🎯 应用场景
GAUGE的研究成果在医疗影像分析、自动驾驶、情感识别等领域具有广泛的应用潜力,尤其是在处理多模态数据时,能够有效提升模型的鲁棒性和准确性。未来,该框架可进一步扩展至更多实际场景,推动多模态学习的发展。
📄 摘要(原文)
Multimodal classification typically assumes all modalities are available, yet real-world inputs are often incomplete. Imputation and dynamic fusion can mitigate such incompleteness, but existing methods operate at a coarse modality level and thus cannot retain reliable components while suppressing misleading ones within the same recovered modality, compromising prediction reliability. To address this issue, we propose GAUGE, a lightweight counterfactual gating framework for incomplete multimodal classification. GAUGE first imputes missing modalities with a frozen imputer and encodes observed and recovered inputs uniformly as fine-grained evidence units. Rather than intervening on each unit explicitly, GAUGE scores the counterfactual effect of replacing every unit with a reference representation through prediction-aware Taylor evidence scores, all obtained in a single forward-backward pass. These scores are mapped to continuous gates, which are converted into additive attention-logit biases for unit-wise evidence modulation without altering the backbone architecture. Experiments across six benchmarks demonstrate that GAUGE outperforms strong baselines across diverse incomplete-input settings. Furthermore, a Taylor remainder theoretical analysis characterizes the error of the first-order approximation relative to the exact counterfactual effect, establishing GAUGE as a principled and scalable framework for fine-grained evidence control under modality incompleteness.