MAG: MAnifold Guided Semi-Supervised Multi-modal In-Context Learning

📄 arXiv: 2608.12724v1 📥 PDF

作者: Zirui Cheng, Xun Xu, Tiankai Chen, Fady Rezk, Bowen Zheng, Xiaodong Shi, Shijie Li, Kangkang Lu, Bharadwaj Veeravalli, Nancy F. Chen

分类: cs.LG

发布日期: 2026-08-13


💡 一句话要点

提出MAG框架以提升多模态少样本学习效果

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 少样本学习 多模态学习 半监督学习 示例选择 图传播 大语言模型 计算机视觉 自然语言处理

📋 核心要点

  1. 现有的少样本上下文学习方法对示例的质量和覆盖度要求高,导致性能不稳定。
  2. MAG框架通过半监督传播方法,利用未标记数据来优化多模态示例选择,提高学习效率。
  3. 在八个多模态基准测试中,MAG在标签稀缺的情况下表现优异,伪标记预算有限时仍能显著提升性能。

📝 摘要(中文)

少样本的上下文学习(ICL)在多模态大语言模型(MLLMs)中能够实现任务适应而无需参数更新,但其性能对所选示例的质量和覆盖度高度敏感。尽管未标记的多模态数据丰富,但如何利用这些数据进行ICL仍然不明确。本文提出MAG(MAnifold-Guided半监督上下文示例选择),这是一个高效的框架,通过利用未标记数据来改善多模态ICL。MAG将示例选择形式化为多模态图上的半监督传播问题,并采用两阶段策略:第一阶段通过相关性评分传播识别出一组高影响力的未标记样本进行伪标记,降低MLLM推理成本;第二阶段使用多模态相关性选择最终示例。实验表明,文本表示在相关性传播中更为有效,而视觉和文本模态对高质量示例选择至关重要。

🔬 方法详解

问题定义:本文旨在解决在多模态大语言模型中,少样本上下文学习对示例质量和覆盖度敏感的问题。现有方法在未标记数据的利用上存在不足,导致学习效果不理想。

核心思路:MAG框架的核心思想是将示例选择视为多模态图上的半监督传播问题,通过有效利用未标记数据来增强示例选择的质量和效率。

技术框架:MAG采用两阶段策略:第一阶段进行相关性评分传播,以识别高影响力的未标记样本进行伪标记;第二阶段则利用多模态相关性选择最终的示例。

关键创新:MAG的主要创新在于将示例选择问题形式化为图传播问题,并通过半监督学习有效利用未标记数据,显著提升了示例选择的质量。与现有方法相比,MAG在推理成本和示例选择效率上具有明显优势。

关键设计:在设计上,MAG强调文本表示在相关性传播中的有效性,同时结合视觉和文本模态,以确保高质量的示例选择。具体的参数设置和损失函数设计在实验中经过优化,以实现最佳性能。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在八个多模态基准测试中,MAG框架在标签稀缺的情况下表现优异,相较于强基线方法,显著提升了性能。具体而言,MAG在有限的伪标记预算下,能够实现高达XX%的性能提升,展示了其在多模态学习中的有效性和实用性。

🎯 应用场景

MAG框架在多模态学习、自然语言处理和计算机视觉等领域具有广泛的应用潜力。其能够有效利用未标记数据的特性,使得在数据稀缺的情况下仍能实现高效的任务适应,具有重要的实际价值和未来影响。尤其在医疗影像分析、自动驾驶和智能客服等场景中,MAG的应用前景广阔。

📄 摘要(原文)

Few-shot in-context learning (ICL) with multi-modal large language models (MLLMs) enables task adaptation without parameter updates, but its performance is highly sensitive to the quality and coverage of the selected demonstrations. While unlabeled multi-modal data is abundant, it remains elusive how to exploit them for ICL. We propose MAG (MAnifold-Guided semi-supervised in-context demonstra- tion selection), an efficient framework that leverages unlabeled data to improve multi-modal ICL. MAG formulates demonstration selection as a semi-supervised propagation problem on a multi-modal graph and adopts a two-stage strategy: (i) relevance score propagation identifies a compact set of high-impact unlabeled samples for pseudo-labeling, reducing MLLM inference cost; (ii) multi-modal relevance is used to select the final demonstrations. We show that textual represen- tations are more effective for relevance propagation, while both visual and textual modalities are crucial for high-quality demonstration selection. Experiments on eight multi-modal benchmarks demonstrate that MAG consistently outperforms strong baselines in label-scarce regimes, achieving significant gains with a limited pseudo-labeling budget.