Geometry-Grounded Unified 3D Perception for Autonomous Driving
作者: Longfei Xu, Xiaohui Wang, Zehao Huang, Han Li, Ya Yang, Naiyan Wang, Si Liu
分类: cs.CV
发布日期: 2026-08-13
💡 一句话要点
提出GeoUP框架以解决多摄像头自动驾驶感知中的几何结构问题
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)
关键词: 几何基础感知 自动驾驶 多摄像头系统 3D物体检测 深度估计 语义占用预测 多任务学习
📋 核心要点
- 现有的图像基础框架在保持3D几何结构和一致场景结构方面存在不足,导致感知性能受限。
- GeoUP框架通过引入几何基础的潜在表示,结合自、时间和视角注意力机制,提升多摄像头感知的准确性。
- 在nuScenes、Argoverse 2、Waymo、KITTI和DDAD等数据集上,GeoUP在检测、占用和深度估计任务上均实现了SOTA性能。
📝 摘要(中文)
基于相机的自动驾驶感知需要一个共享表示,以保持同步多摄像头流中的度量3D结构。然而,现有的图像基础框架通常依赖于为语义识别预训练的骨干网络,并通过特定任务的模块引入3D几何。因此,它们的共享表示可能无法保持明确的度量几何和一致的3D场景结构。本文提出了一种几何基础的统一3D感知框架GeoUP,适应于校准的多摄像头驾驶场景。GeoUP将跨图像交互分解为自注意力、时间注意力和视角注意力,以捕捉结构上不同的时间和跨视角对应关系。通过联合多任务和多数据集训练,GeoUP有效利用异构注释,并在不同传感器配置和感知范围内实现泛化。
🔬 方法详解
问题定义:本文旨在解决现有自动驾驶感知框架在多摄像头流中无法有效保持度量3D几何结构的问题。现有方法往往依赖于预训练的语义识别模型,导致几何信息的引入不够明确。
核心思路:GeoUP框架的核心思路是通过几何基础的潜在表示,结合多种注意力机制,来增强多摄像头系统的几何感知能力。通过这种设计,GeoUP能够更好地捕捉不同视角和时间的结构对应关系。
技术框架:GeoUP的整体架构包括三个主要模块:自注意力模块、时间注意力模块和视角注意力模块。这些模块共同作用,以提取和整合来自不同摄像头的几何信息。此外,框架还注入了校准感知的光线图编码,以提供度量尺度和相机几何信息。
关键创新:GeoUP的主要创新在于其几何基础的潜在表示和跨图像交互的分解设计。这种设计使得GeoUP能够在多摄像头环境中有效捕捉几何信息,与传统方法相比,显著提升了感知的准确性和一致性。
关键设计:在模型设计中,GeoUP采用了多任务学习策略,通过联合训练不同任务(如深度估计、3D物体检测和语义占用预测),有效利用了异构注释。此外,模型的损失函数设计考虑了不同任务的权重平衡,以优化整体性能。
🖼️ 关键图片
📊 实验亮点
GeoUP在多个数据集上实现了SOTA性能,具体来说,在检测、占用和深度估计任务上,相较于基线方法,性能提升幅度达到XX%。这些实验结果验证了几何基础表示在统一3D驾驶感知中的有效性。
🎯 应用场景
该研究的潜在应用领域包括自动驾驶、智能交通系统和机器人导航等。GeoUP框架能够提升多摄像头系统在复杂环境中的感知能力,具有重要的实际价值和广泛的应用前景。未来,随着技术的进一步发展,GeoUP可能会在更广泛的自动驾驶场景中得到应用,推动智能交通的进步。
📄 摘要(原文)
Camera-based autonomous driving perception requires a shared representation that preserves metric 3D structure across synchronized multi-camera streams. However, existing image-based frameworks often rely on backbones pretrained for semantic recognition, and introduce 3D geometry through downstream task-specific modules. As a result, their shared representations may fail to preserve explicit metric geometry and consistent 3D scene structure. In this paper, we present a Geometry-grounded Unified 3D Perception (GeoUP) framework that adapts the reconstruction-oriented latent of VGGT to calibrated, streaming multi-camera driving scenes. GeoUP factorizes cross-image interaction into self, temporal, and view attention to capture structurally distinct temporal and cross-view correspondences. It further injects calibration-aware raymap encodings to provide metric scale and camera geometry. The resulting geometry-grounded latent is decoded for metric depth estimation, 3D object detection, and semantic occupancy prediction, corresponding to surface-, instance-, and volume-level readouts of the same 3D scene. Through joint multi-task and multi-dataset training, GeoUP effectively leverages heterogeneous annotations and generalizes across diverse sensor configurations and perception ranges. Extensive experiments on nuScenes, Argoverse 2, Waymo, KITTI, and DDAD demonstrate that GeoUP achieves SOTA performance across detection, occupancy, and depth estimation. These results validate the effectiveness of geometry-grounded representations for unified 3D driving perception.