ViTAMINS: An Empirical Study of Training Self-Supervised Vision Transformers with Synthetic Hard Negatives

📄 arXiv: 2609.01041v1 📥 PDF

作者: Nikos Giakoumoglou, Andreas Floros, Kleanthis-Marios Papadopoulos, Tania Stathaki

分类: cs.CV, cs.AI, cs.LG

发布日期: 2026-09-01

备注: WACV 2027


💡 一句话要点

提出ViTAMINS以提升自监督视觉变换器的表示质量

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 自监督学习 视觉变换器 对比学习 合成负样本 图像检索 迁移学习 资源效率

📋 核心要点

  1. 现有的自监督学习方法在表示质量和资源效率上存在不足,难以充分利用图像的语义信息。
  2. ViTAMINS通过引入合成困难负样本,增强了无监督视觉变换器的预训练过程,从而提升了表示能力。
  3. 实验结果表明,ViTAMINS在多个任务上均显著优于基线方法,分类性能提升高达11.3%。

📝 摘要(中文)

我们提出了ViTAMINS,一种将合成困难负样本整合到无监督视觉变换器预训练中的方法,以提高表示质量。我们的方法在ImageNet及迁移学习、图像检索、复制检测和图像、视频分割任务上进行了全面基准测试。值得注意的是,我们提出的负样本产生了新兴特性,使得学习到的表示包含图像语义内容的显性信息,并且作为优秀的分类器表现出色(相较基线提升高达11.3%)。ViTAMINS通过对现有对比框架的简单修改实现了这些优势,并在资源效率上超越了竞争方法,例如我们的ViT-B在性能上超过了ViT-L的V-JEPA。我们的发现促使人们重新考虑对比学习作为一种更简单但强大的替代方案,以应对主流的生成和自蒸馏方法。

🔬 方法详解

问题定义:本论文旨在解决自监督视觉变换器在表示质量和资源效率方面的不足。现有方法未能充分利用图像的语义信息,导致学习到的表示效果不佳。

核心思路:ViTAMINS的核心思路是将合成困难负样本引入无监督预训练中,以增强模型对图像语义内容的理解和分类能力。通过这种方式,模型能够学习到更具区分性的特征表示。

技术框架:ViTAMINS的整体架构包括对比学习框架,结合合成困难负样本的生成模块。预训练阶段通过对比损失函数优化模型,使其能够在多种任务中表现出色。

关键创新:ViTAMINS的主要创新在于引入合成困难负样本,这一设计使得模型在学习过程中能够捕捉到更丰富的语义信息,与传统的对比学习方法相比,显著提升了表示质量。

关键设计:在参数设置上,ViTAMINS采用了优化的对比损失函数,并在网络结构上进行了适当的调整,以适应合成负样本的引入。这些设计使得模型在资源使用上更加高效,同时保持了良好的性能。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

实验结果显示,ViTAMINS在多个任务上均表现优异,尤其是在分类任务中,相较于基线方法提升高达11.3%。此外,ViT-B在资源效率上超越了V-JEPA的ViT-L,展示了其在实际应用中的优势。

🎯 应用场景

该研究的潜在应用领域包括图像检索、视频分析、自动标注和智能监控等。通过提升自监督学习的效果,ViTAMINS能够在实际应用中提供更高的准确性和效率,推动计算机视觉技术的进一步发展。

📄 摘要(原文)

We introduce ViTAMINS, a method that integrates synthetic hard negatives into unsupervised vision transformer pretraining to improve representation quality. Our approach is thoroughly benchmarked on ImageNet and transfer learning, image retrieval, copy detection, and image, video segmentation tasks. Notably, our proposed negatives give rise to emergent properties, where learned representations contain explicit information about the semantic content of an image and serve as excellent classifiers (up to +11.3% over baselines). ViTAMINS achieves these benefits through simple modifications to existing contrastive frameworks and outperforms competing methods while being more resource efficient, e.g., our ViT-B surpasses V-JEPA with ViT-L. Our findings motivate reconsidering contrastive learning as a simpler yet powerful alternative to dominant generative and self-distillation approaches.