Failure-Informed Image Self-Augmentation for Multimodal Large Language Model Self-Improvement

📄 arXiv: 2608.03733v1 📥 PDF

作者: Chunyang Jiang, Pingping Zhang, Yuzhi Zhao, Wenao Ma, Zhijian Hou, Mengyang Wu, Yiyang Cai, Senkang Hu, Sitong Cheng, Chi-Min Chan, Wei Xue, Yike Guo

分类: cs.AI

发布日期: 2026-08-04


💡 一句话要点

提出FISA框架以解决多模态大语言模型自我改进问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态大语言模型 自我增强 图像处理 视觉问答 数据效率 语义一致性 模型改进

📋 核心要点

  1. 现有的多模态大语言模型自我增强方法主要集中于文本,图像增强研究相对不足,导致模型在图像处理上的能力未能得到充分提升。
  2. 本文提出的FISA框架通过利用模型自身的失败案例生成增强图像,旨在提高模型在视觉任务中的表现,特别是在图像增强方面。
  3. 实验结果显示,FISA在视觉问答基准上显著提升了模型性能,并且与现有文本自我增强方法兼容,合成样本的数据效率优于通用图像增强基线。

📝 摘要(中文)

多模态大语言模型(MLLMs)在视觉-语言任务中表现出色,但其进展依赖于大规模高质量的多模态数据,成本高昂。自我增强作为一种替代方案,能够在没有外部监督的情况下扩展训练数据。然而,现有的自我增强方法主要集中于文本,图像增强则相对欠缺,通常依赖于通用或手工设计的变换,未能有效对齐模型的实际不足。本文提出了基于失败案例的图像自我增强框架(FISA),通过构建模型自身失败案例的增强图像,生成视觉上具有挑战性但保留答案的图像变体,并通过自我检验验证其有效性,应用双重保真度过滤以避免语义失真。实验结果表明,该方法在视觉问答基准上在分布内和分布外设置中均能持续提升性能。

🔬 方法详解

问题定义:本文旨在解决多模态大语言模型在图像处理上的自我增强不足,现有方法多集中于文本,导致图像增强效果不佳。

核心思路:FISA框架通过构建模型自身失败案例的增强图像,生成视觉挑战性强但答案保留的图像变体,以此提升模型的自我改进能力。

技术框架:FISA的整体架构包括三个主要模块:失败案例识别、图像增强生成和自我检验与过滤。首先识别模型在视觉任务中的失败案例,然后生成相应的增强图像,最后通过自我检验验证其有效性并进行双重保真度过滤。

关键创新:FISA的核心创新在于利用模型自身的失败案例进行图像自我增强,与传统的通用图像增强方法相比,能够更好地对齐模型的实际不足,提升增强图像的有效性。

关键设计:在设计上,FISA采用了特定的损失函数以确保生成图像的语义一致性,并通过双重保真度过滤机制来避免语义失真,确保增强图像的质量。具体参数设置和网络结构细节在实验部分进行了详细描述。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,FISA在视觉问答基准上显著提升了模型性能,在分布内和分布外设置中均表现出一致的改进,合成样本的数据效率超过了通用图像增强基线,验证了所提出的过滤策略的有效性。

🎯 应用场景

FISA框架在视觉问答、图像识别等多模态任务中具有广泛的应用潜力。通过自我增强,模型能够在缺乏大量标注数据的情况下,持续提升其性能,具有重要的实际价值和未来影响,尤其在数据稀缺的领域中尤为显著。

📄 摘要(原文)

Multimodal large language models (MLLMs) have achieved remarkable performance across vision-language tasks, but their progress depends heavily on large-scale, high-quality multimodal data that are costly to annotate. Self-augmentation offers a promising alternative by enabling models to expand their own training data without external supervision. However, existing MLLM self-augmentation methods are largely text-centric, while image augmentation remains underexplored and typically relies on generic or handcrafted transformations that are weakly aligned with the model's actual incapability. We propose Failure-informed Image Self-Augmentation (\textbf{FISA}), a framework for MLLM self-improvement that constructs augmented images from the model's own failure cases. Our method generates visually challenging yet answer-preserving image complications, verifies their utility through self-examination, and applies dual fidelity filtering to avoid semantic distortion. Experiments on visual question answering benchmarks show that the proposed method consistently improves performance across both in-distribution and out-of-distribution settings. Further experiments validate the compatibility of FISA with existing textual self-augmentation approaches, the superior data efficiency of the synthesized samples over generic image augmentation baselines, and the practical effectiveness of the proposed filtering strategy.