Scaling Vision-Language Models Is Not Enough to Mitigate Bias

📄 arXiv: 2607.28211v1 📥 PDF

作者: Ioannis Sarridis, Ioannis Kompatsiaris, Symeon Papadopoulos

分类: cs.CV

发布日期: 2026-07-30


💡 一句话要点

大规模研究揭示视觉-语言模型偏见问题的复杂性

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉-语言模型 偏见分析 多模态系统 数据集整理 模型鲁棒性 性能评估 训练数据质量

📋 核心要点

  1. 现有的视觉-语言模型在处理偏见时的鲁棒性尚未得到充分理解,尤其是在不同评估基准下表现不一。
  2. 本文通过大规模实证研究,分析了模型规模、训练数据质量与偏见表现之间的关系,提出了数据集整理的重要性。
  3. 实验结果显示,经过整理的数据集在偏见评估中性能提升可达25%,并揭示了架构选择对模型表现的影响依赖于具体基准。

📝 摘要(中文)

视觉-语言模型(VLMs)如CLIP已成为多模态系统的基础,但其对虚假关联的鲁棒性在大规模下仍不甚明了。本文首次对194个公开VLM进行大规模实证研究,涵盖16个模型家族、24个训练数据集及三个评估基准。研究发现,模型规模与性能的Spearman相关性在不同评估基准下逐渐减弱,而训练数据的属性(大小和质量)与最差组准确率之间的关系更为一致。经过整理的数据集在可比规模下可提高多达25%的性能,且架构选择的影响因基准的性质而异。

🔬 方法详解

问题定义:本文旨在解决视觉-语言模型在处理偏见时的鲁棒性不足的问题,现有方法在不同评估基准下的表现差异较大。

核心思路:通过对194个公开VLM的系统性分析,探讨模型规模、训练数据质量与偏见表现之间的关系,强调整理数据集的重要性。

技术框架:研究采用了大规模实证分析的方法,涵盖多个模型家族和训练数据集,使用ImageNet、CelebA和UrbanCars作为评估基准,分析模型性能与偏见的关系。

关键创新:本研究的创新在于首次系统性地评估了不同规模的VLM在处理偏见时的表现,揭示了训练数据质量对模型性能的显著影响。

关键设计:研究中关注了模型的规模、训练数据的大小和质量,以及架构选择(如图像分辨率和补丁大小)对模型在不同偏见基准下表现的影响。具体参数设置和损失函数的设计未在摘要中详细说明。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,模型规模与性能的Spearman相关性在不同评估基准下显著减弱,具体为ImageNet的相关性为0.68,而在单属性和多属性偏见基准下分别降至0.48和0.05。此外,经过整理的数据集在可比规模下可提高多达25%的性能,显示出数据质量的重要性。

🎯 应用场景

该研究的结果对多模态系统的设计与优化具有重要意义,尤其是在需要处理偏见和提高模型鲁棒性的应用场景中,如自动驾驶、图像识别和社交媒体分析等领域。未来,研究者可以基于这些发现改进模型架构和训练策略,以提升模型的公平性和准确性。

📄 摘要(原文)

Vision-Language Models (VLMs) such as CLIP are now foundational to multimodal systems, yet their robustness to spurious correlations remains poorly understood at scale. We present the first large-scale empirical study of 194 publicly available VLMs, including 16 model families, covering a wide range of model sizes, 24 training datasets, and three evaluation benchmarks, namely ImageNet (overall performance), CelebA (typical single-attribute bias), and UrbanCars (complex multi-attribute biases). Across these settings, the Spearman correlation between model scale and performance weakens as evaluation shifts from ImageNet ($ρ{=}0.68$) to single-attribute ($ρ{=}0.48$) and further to multi-attribute ($ρ{=}0.05$) bias benchmarks. In contrast, properties of the training data (size and quality) show more consistent relationships with worst-group accuracy across both bias benchmarks. Notably, curated datasets yield improvements of up to 25% over uncurated alternatives at a comparable scale. Finally, the effect of architectural choices (e.g., patch size, image resolution) is highly context-dependent, varying with the nature of the benchmark, including the type of bias and its spatial distribution within images.