JEPADepth: Masked Predictive Representation Learning for Self-Supervised Monocular Depth Estimation
作者: Ionuţ Grigore, Călin-Adrian Popa
分类: cs.CV
发布日期: 2026-07-29
💡 一句话要点
提出JEPADepth以解决自监督单目深度估计问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱三:空间感知与语义 (Perception & Semantics) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 自监督学习 单目深度估计 深度学习 视觉变换器 掩蔽预测 KITTI数据集 机器人导航 环境感知
📋 核心要点
- 现有的自监督单目深度估计方法通常依赖于光度重建损失,导致深度估计与姿态和外观假设紧密耦合,限制了其性能。
- JEPADepth通过引入受I-JEPA启发的掩蔽预测损失,增强了标准光度管道,从而提高了深度估计的准确性和鲁棒性。
- 在KITTI数据集上,JEPADepth在不改变推理架构的情况下,显著提升了性能,并在零样本迁移任务中表现优异。
📝 摘要(中文)
自监督单目深度估计通常依赖于光度重建损失,这些损失将深度、姿态和外观假设结合在一起。本文提出了JEPADepth,一个自监督单目深度框架,结合了受图像联合嵌入预测架构(I-JEPA)启发的补充训练目标。该方法在标准光度管道中增加了一个在预训练DINOv3视觉变换器编码器的表示空间中计算的掩蔽预测损失。预测器在结构化掩蔽下从可见上下文区域嵌入推断目标区域嵌入,并在推理时与目标编码器一起丢弃,不增加部署成本。在KITTI数据集上,增加JEPA目标始终提高了性能,而不改变推理时的架构。与先前的单目自监督方法相比,JEPADepth在标准基准上与最先进的基于变换器的方法竞争,并在强大的CNN基线之上表现更佳。在零样本迁移中(在KITTI上训练并在不微调的情况下评估),JEPADepth在Make3D和Cityscapes的多个指标上实现了最佳或接近最佳的性能。
🔬 方法详解
问题定义:本文旨在解决自监督单目深度估计中光度重建损失的局限性,现有方法在深度、姿态和外观假设之间存在紧密耦合,影响了估计的准确性和泛化能力。
核心思路:JEPADepth的核心思路是引入掩蔽预测损失,利用预训练的DINOv3视觉变换器编码器的表示空间,增强深度学习的自监督能力。通过结构化掩蔽,预测器能够从可见区域推断目标区域的嵌入,从而提高深度估计的准确性。
技术框架:JEPADepth的整体架构包括标准光度管道和掩蔽预测模块。光度管道负责基本的深度估计,而掩蔽预测模块则在表示空间中进行目标区域的嵌入推断。推理时,预测器和目标编码器被丢弃,确保不增加部署成本。
关键创新:JEPADepth的主要创新在于结合了掩蔽预测损失与标准光度损失,形成了一种新的自监督学习框架。这种方法与传统的深度估计方法相比,能够更好地利用上下文信息,提升了深度估计的性能。
关键设计:在设计上,JEPADepth使用了DINOv3作为基础编码器,采用了结构化掩蔽策略来生成目标区域的嵌入。此外,损失函数的设计上,结合了光度损失和掩蔽预测损失,以实现更好的学习效果。整体架构保持了推理时的高效性,确保了实际应用的可行性。
🖼️ 关键图片
📊 实验亮点
在KITTI数据集上,JEPADepth通过引入JEPA目标,显著提高了性能,相比于基于DINOv3的光度基线,表现出一致的提升。在零样本迁移任务中,JEPADepth在Make3D和Cityscapes上达到了最佳或接近最佳的性能,展示了其优越的泛化能力。
🎯 应用场景
JEPADepth的研究成果在自动驾驶、机器人导航和增强现实等领域具有广泛的应用潜力。通过提高单目深度估计的准确性,该方法能够为环境感知和三维重建提供更可靠的支持,推动相关技术的发展和应用。
📄 摘要(原文)
Self-supervised monocular depth estimation typically relies on photometric reconstruction losses that couple depth, pose, and appearance assumptions. In this paper, we propose JEPADepth, a self-supervised monocular depth framework that incorporates a complementary training objective inspired by Image Joint-Embedding Predictive Architectures (I-JEPA) for self-supervised depth learning. Our method augments a standard photometric pipeline with a masked prediction loss computed in the representation space of a pretrained DINOv3 Vision Transformer encoder. A predictor infers target-region embeddings from visible context-region embeddings under structured masking, and is discarded along with the target encoder at inference time, adding no deployment cost. On KITTI, adding the JEPA objective consistently improves performance over the same DINOv3-based photometric baseline, without changing the inference-time architecture. Compared to prior monocular self-supervised methods, JEPADepth is competitive with state-of-the-art transformer-based approaches and outperforms strong CNN-based baselines on the standard benchmark. In zero-shot transfer (trained on KITTI and evaluated without fine-tuning), JEPADepth achieves the best or near-best performance among the compared methods on both Make3D and Cityscapes across multiple metrics.