A Controlled Study of Self-Supervised Image and Video Pretraining under Limited Resources

📄 arXiv: 2608.13183v1 📥 PDF

作者: Brunó B. Englert, Gijs Dubbelman

分类: cs.CV

发布日期: 2026-08-13


💡 一句话要点

提出自监督学习方法以在资源有限条件下优化图像和视频预训练

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 自监督学习 视觉基础模型 图像理解 视频理解 资源限制 DINOv2 多模态学习 性能优化

📋 核心要点

  1. 现有视觉基础模型通常需要大量数据和计算资源,导致在资源有限的情况下难以实现有效的图像和视频理解。
  2. 本文通过控制实验研究自监督学习目标在有限资源下的表现,提出结合DINOv2与视频SSL目标的方案,以优化性能。
  3. 实验结果显示,DINOv2预训练在资源有限情况下表现最佳,结合视频SSL目标可提升图像任务性能,但对视频任务性能有一定影响。

📝 摘要(中文)

视觉基础模型是图像和视频理解的基石,但通常需要大量数据和计算资源。当前预训练视觉基础模型所需的规模可能不可持续或不必要,而在有限资源下获得有效模型的显著好处值得关注。本文通过对比对比学习、重建、特征预测和扩散目标,研究了在匹配数据、架构和计算预算下自监督学习(SSL)目标的表现。结果表明,DINOv2风格的预训练在资源有限的情况下表现最强。此外,将DINOv2与视频SSL目标(如VideoMAE)结合显著提高了图像分类和分割性能,但降低了视频跟踪和相机姿态估计性能,揭示了语义与几何表示学习之间的重要权衡。这些发现表明,在资源有限的环境中,结合图像和视频SSL目标是有益的,同时强调了需要改进的方法,以更好地平衡语义、时间和几何监督。

🔬 方法详解

问题定义:本文旨在解决在有限资源条件下自监督学习(SSL)目标的有效性问题。现有方法通常依赖于大量数据和计算,导致在资源受限的环境中难以应用。

核心思路:通过对比多种自监督学习目标(如对比学习、重建、特征预测和扩散),探索在资源限制下如何优化图像和视频预训练的性能,特别是结合DINOv2与视频SSL目标的效果。

技术框架:研究采用控制实验设计,确保数据、架构和计算预算的一致性,比较不同SSL目标的表现。主要模块包括图像和视频的独立训练以及联合训练的SSL目标。

关键创新:最重要的创新在于发现DINOv2风格的预训练在资源有限情况下的优越性,以及结合视频SSL目标对图像任务的显著提升,同时揭示了在语义与几何表示学习之间的权衡。

关键设计:实验中采用了特定的损失函数和网络结构,确保在不同任务中进行有效的特征学习,特别是在图像分类、分割和视频跟踪等任务中进行优化。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

实验结果表明,DINOv2风格的预训练在资源有限条件下表现最佳,显著提高了图像分类和分割性能,具体提升幅度达到了X%(具体数据未知)。然而,结合视频SSL目标后,视频跟踪和相机姿态估计性能有所下降,揭示了任务间的权衡关系。

🎯 应用场景

该研究的潜在应用领域包括计算机视觉、自动驾驶、监控系统等,能够在资源受限的环境中实现高效的图像和视频理解。未来可能推动自监督学习在更多实际场景中的应用,提升模型的普适性和效率。

📄 摘要(原文)

Visual foundation models are a cornerstone of image and video understanding but typically require large amounts of data and computation. The current scale required for pretraining visual foundation models may be unsustainable or unnecessary, and significant benefits arise when effective models can be obtained with fewer resources. To better understand how self-supervised learning (SSL) objectives behave under resource constraints, we conduct a controlled study of image and video SSL objectives under matched data, architecture, and compute budgets. We compare contrastive, reconstruction, feature-prediction, and diffusion objectives and evaluate both standalone and jointly trained image-video SSL formulations across a diverse set of image and video understanding tasks. Our results show that DINOv2-style pretraining consistently provides the strongest overall performance under limited resources. Furthermore, combining DINOv2 with video SSL objectives such as VideoMAE substantially improves image classification and segmentation performance, but degrades video tracking and camera-pose estimation performance, revealing an important tradeoff between semantic and geometric representation learning. These findings suggest that combining image and video SSL objectives can be beneficial in resource-limited settings, while highlighting the need for improved methods that better balance semantic, temporal, and geometric supervision.