From Perspective to Fisheye Depth Estimation and Open-Vocabulary Segmentation

📄 arXiv: 2608.27860v1 📥 PDF

作者: Rit Gangopadhyay, Alex Wong

分类: cs.CV, cs.AI

发布日期: 2026-08-28

🔗 代码/项目: GITHUB


💡 一句话要点

提出DEX以解决鱼眼相机深度估计和开放词汇分割问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 深度估计 鱼眼相机 开放词汇分割 视觉基础模型 自监督学习 失真扩展器 计算机视觉

📋 核心要点

  1. 现有视觉基础模型在处理鱼眼相机图像时,由于径向失真导致输出错误,无法有效泛化。
  2. 本文提出的DEX方法通过学习失真系数,解决了鱼眼图像与透视图像之间的分布偏移问题。
  3. 在单目深度估计和开放词汇分割任务中,DEX在多个数据集上均显著提升了模型性能,超越了基线方法。

📝 摘要(中文)

视觉基础模型能够在三维场景中进行高保真估计,其成功归因于在大规模透视图像数据集上的训练。然而,当这些模型应用于鱼眼相机捕获的广视场图像时,由于图像像素的径向失真,模型输出会出现错误。为此,本文提出了一种方法,通过一组可学习的参数,称为失真扩展器(DEX),来对鱼眼相机进行模型泛化。DEX通过最小化自监督对齐损失,将鱼眼图像的潜在嵌入转换为类似透视图像的形式,从而恢复高保真估计。DEX在单目深度估计和开放词汇分割任务中表现出色,且在室内和室外鱼眼数据集上均取得了显著提升。

🔬 方法详解

问题定义:本文旨在解决视觉基础模型在鱼眼相机图像上泛化能力不足的问题。现有方法在处理鱼眼图像时,由于径向失真,导致模型输出不准确,无法有效应用于实际场景。

核心思路:论文提出的核心思路是引入失真扩展器(DEX),通过学习鱼眼失真系数和潜在空间中的分布偏移,来对鱼眼图像进行有效的特征转换,使其嵌入与透视图像相似,从而提高估计精度。

技术框架:整体架构包括数据预处理、DEX模块和损失计算三个主要部分。首先,输入鱼眼图像经过DEX模块进行特征转换,然后通过自监督对齐损失进行优化,最终输出高保真估计结果。

关键创新:DEX的最大创新在于其架构和任务无关性,能够适用于不同的网络结构(如卷积和Transformer),并且通过学习失真系数来支持相机标定,与传统方法相比具有更高的灵活性和准确性。

关键设计:DEX的设计包括可学习的失真参数和自监督对齐损失函数,确保了鱼眼图像的潜在嵌入能够有效地与透视图像对齐。此外,DEX的激活值可以解码为失真系数,进一步支持相机标定的需求。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在实验中,DEX在室内和室外鱼眼数据集上均表现出色,相比于基线方法,单目深度估计的准确率提升了XX%,开放词汇分割任务的mIoU提升了YY%。这些结果表明,DEX在不同任务和架构下均能有效提高模型性能。

🎯 应用场景

该研究的潜在应用领域包括自动驾驶、虚拟现实和增强现实等场景,尤其是在需要处理广视场图像的任务中。通过提高鱼眼相机的深度估计和分割能力,能够显著提升这些应用的准确性和可靠性,具有重要的实际价值和未来影响。

📄 摘要(原文)

Vision foundation models are capable of generalizing across 3-dimensional (3D) scenes with high-fidelity estimates; their empirical success can be attributed to training on large-scale datasets of perspective images. However, when transferred to wide field-of-view (FoV) images, such as those captured by fisheye cameras, they return erroneous outputs due to a covariate shift stemming from the radial distortion on the image pixels. We propose a method to generalize vision foundation models to fisheye cameras. The crux of our method lies in a set of learnable parameters, termed Distortion Extenders (DEX), that model the fisheye distortion coefficients and the distributional shift between fisheye and perspective images encoded in the latent space. By minimizing a self-supervised alignment loss, DEX transforms the latent embeddings of fisheye images to resemble those of perspective images to recover high-fidelity estimates. DEX is architecture- and task-agnostic: We demonstrate DEX on monocular depth estimation and open-vocabulary segmentation for convolution- and Transformer-based architectures, where we consistently improve over baselines across indoor and outdoor fisheye datasets. As a byproduct, the activations of DEX can also be decoded to distortion coefficients to support camera calibration. Code available at: https://github.com/Suchisrit/DEX.