Video Generative Models as Geometry Learner

📄 arXiv: 2608.28549v1 📥 PDF

作者: Haosen Yang, Jifei Song, Zhensong Zhang, Xiatian Zhu, Jiankang Deng

分类: cs.CV, cs.AI

发布日期: 2026-08-28

备注: 19 pages, 4 figures, 5 tables. Project page: https://happy-hsy.github.io/projects/GeoNeXt/


💡 一句话要点

提出GeoNeXt以解决几何估计任务中的数据效率问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 几何估计 视频生成模型 深度学习 数据效率 联合建模

📋 核心要点

  1. 现有几何估计方法要么独立训练特定模型,要么需要大量标记数据,导致效率低下。
  2. 本文提出GeoNeXt,利用预训练的视频生成模型作为几何估计的统一框架,通过下一帧预测任务实现数据高效学习。
  3. 实验结果显示,GeoNeXt在多个数据集上实现了零样本深度和法线估计的显著提升,超越了传统方法。

📝 摘要(中文)

最近的几何估计生成方法适应了预训练的图像扩散模型,将任务视为图像条件生成。然而,这些方法要么独立训练特定任务的几何模型,失去了探索几何目标内在关联的机会,要么共同微调修改后的图像扩散骨干,通常需要大量标记数据。为了解决这些局限性,本文将预训练的视频生成模型重新利用,提出了一种统一且数据高效的几何估计框架GeoNeXt,创新性地将其表述为下一帧预测任务。实验结果表明,GeoNeXt在零样本单目深度和表面法线估计方面超越了以往的任务特定和统一生成竞争者,同时使用的训练数据显著减少。值得注意的是,该方法在多个基准测试中表现优异,甚至与在超过100倍数据上训练的判别性最先进方法相抗衡。

🔬 方法详解

问题定义:本文旨在解决几何估计任务中数据效率低下的问题。现有方法要么独立训练特定任务的几何模型,导致无法利用几何目标之间的内在关联,要么需要大量标记数据进行微调,限制了其应用范围。

核心思路:论文提出的GeoNeXt方法通过将预训练的视频生成模型重新利用,创新性地将几何估计任务表述为下一帧预测任务,从而实现了图像与几何目标的联合建模,提升了数据利用效率。

技术框架:GeoNeXt的整体架构包括视频生成模型的预训练阶段和几何估计的微调阶段。首先,利用视频模型提取结构化知识和丰富的先验信息,然后通过联合建模实现图像与几何目标的有效学习。

关键创新:GeoNeXt的核心创新在于将几何估计任务转化为视频生成模型的下一帧预测任务,这一设计使得模型能够自然地继承视频模型的知识,并在数据效率上显著提升。

关键设计:在模型设计中,GeoNeXt采用了特定的损失函数以平衡图像与几何目标的学习,同时在网络结构上进行了适当的调整,以适应联合建模的需求。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

GeoNeXt在多个数据集上实现了零样本单目深度和表面法线估计的显著提升,相比于以往的任务特定和统一生成方法,使用的训练数据减少了超过100倍。实验结果显示,该方法在多个基准测试中表现优异,甚至与在大量数据上训练的判别性最先进方法相抗衡。

🎯 应用场景

该研究的潜在应用领域包括自动驾驶、增强现实和机器人导航等场景,能够为这些领域提供高效的几何估计解决方案。GeoNeXt的创新方法可能会推动相关技术的发展,提升系统的智能化水平和应用广度。

📄 摘要(原文)

Recent generative approaches to geometry estimation adapt pretrained image diffusion models and treat the task as image-conditioned generation. Leveraging off-the-shelf image diffusion models, they either (i) train task-specific geometry models (for depth and surface normal estimation) independently, losing the opportunity of exploring the intrinsic correlation of these geometric targets, or (ii) jointly fine-tune modified image diffusion backbones (e.g., altered self-attention), which typically demands substantial labeled data. To overcome these limitations in a principled fashion, we repurpose pretrained video generative models as a unified and data-efficient framework for geometry estimation, formulated innovatively as a next-frames prediction task. Our method, GeoNeXt, inherits naturally structured knowledge and richer priors from the video model, while further adapting them for joint modeling of images and geometry targets (image <-> geometry), enabling more data efficient and effective learning of geometry. Extensive experiments validate our method for zero-shot monocular depth and surface normal estimation across diverse datasets, outperforming both previous task-specific and unified generative competitors while using substantially less training data. Notably, our method rivals discriminative state-of-the-art approaches trained on over 100x more data and even standouts on several benchmarks.