Dense Metric Depth Completion from Sparse Direct Time-of-Flight Sensors
作者: Hakyeong Kim, Ruicheng Wang, Chengtang Yao, Jiaolong Yang, Min H. Kim
分类: cs.CV, cs.GR
发布日期: 2026-08-05
期刊: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026
💡 一句话要点
提出一种框架以解决稀疏直接飞行时间传感器的密集度量深度补全问题
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)
关键词: 深度补全 直接飞行时间传感器 视觉变换器 深度学习 三维感知 虚拟现实 机器人导航
📋 核心要点
- 现有的深度补全方法在处理稀疏的dToF传感器数据时面临挑战,尤其在噪声和稀疏性严重时性能下降。
- 提出了一种深度引导的双分支视觉变换器编码器,能够分别处理RGB图像和稀疏dToF测量,提升深度补全效果。
- 在六个数据集和三种真实dToF设备上进行测试,模型在准确性和计算效率上均优于现有方法,展示了良好的零样本泛化能力。
📝 摘要(中文)
直接飞行时间(dToF)传感器提供高精度的度量深度,但由于制造成本高和光电二极管阵列尺寸有限,生成的深度图极为稀疏、低分辨率且噪声较大,难以满足虚拟现实、机器人和三维感知等应用的需求。现有的单目和深度补全方法在处理dToF设备的独特采样模式和硬件伪影时表现不佳,尤其在严重稀疏或噪声条件下性能显著下降。本文提出了一种通用框架,能够从稀疏的dToF测量中完成密集度量深度,适用于多种传感器类型、稀疏程度和噪声条件。我们的模型采用深度引导的双分支视觉变换器编码器,分别处理RGB图像和稀疏dToF测量,同时使用掩蔽联合注意力模块确保深度标记可靠地引导图像特征。通过合成数据训练,我们的模型在六个数据集和三种真实dToF设备上实现了强大的零样本泛化,超越了现有最先进的方法。
🔬 方法详解
问题定义:本文旨在解决从稀疏的直接飞行时间(dToF)传感器测量中完成密集度量深度的问题。现有方法在处理dToF设备特有的采样模式和硬件伪影时表现不佳,尤其在数据稀疏和噪声严重的情况下,性能显著下降。
核心思路:提出的框架通过深度引导的双分支视觉变换器编码器,分别处理RGB图像和稀疏dToF测量,利用掩蔽联合注意力模块确保深度标记有效引导图像特征,从而提高深度补全的准确性和鲁棒性。
技术框架:整体架构包括深度引导的双分支视觉变换器编码器和轻量级解码器。编码器处理RGB图像和稀疏深度数据,解码器则高效重建密集度量深度,避免了复杂的后处理步骤。
关键创新:本研究的主要创新在于引入了深度引导的双分支结构和掩蔽联合注意力模块,使得深度信息能够有效引导图像特征,而不被覆盖,从而提升了深度补全的效果。
关键设计:模型设计中采用了轻量级解码器,避免了扩散或重构后处理的复杂性,损失函数则针对深度补全任务进行了优化,确保了训练过程的高效性。通过合成数据生成的训练集,模型能够在多种条件下进行有效训练。
🖼️ 关键图片
📊 实验亮点
实验结果显示,模型在六个不同数据集和三种真实dToF设备上均表现出色,准确性和计算效率均超越了现有最先进的方法,展示了强大的零样本泛化能力,具体性能提升幅度未知。
🎯 应用场景
该研究的潜在应用领域包括虚拟现实、增强现实、机器人导航和三维感知等。通过提供高质量的密集度量深度信息,能够显著提升这些领域的系统性能和用户体验,具有重要的实际价值和未来影响。
📄 摘要(原文)
Direct Time-of-Flight (dToF) sensors provide highly accurate metric depth and are more robust than indirect ToF systems in challenging real-world conditions. However, their high manufacturing cost and limited photodiode array size produce depth maps that are extremely sparse, low-resolution, and noisy, making them unsuitable for VR/XR, robotics, and 3D perception tasks that require dense metric depth. Existing monocular and depth completion methods struggle to handle the unique sampling patterns and hardware artifacts of dToF devices, and their performance often deteriorates significantly under severe sparsity or noise. We present a generalizable framework for dense metric depth completion from sparse dToF measurements, capable of operating across diverse sensor types, sparsity levels, and noise conditions. Our model employs a depth-guided dual-branch Vision Transformer encoder that processes RGB images and sparse dToF measurements separately, while a masked joint attention module allows depth tokens to reliably guide image features without being overwritten by them. A lightweight decoder reconstructs dense metric depth efficiently, without diffusion-based or refinement-heavy post-processing. To address the scarcity of paired training data, we introduce a comprehensive dToF simulation pipeline that reproduces the characteristics of flash, sub-VGA flash, and rotating sensors, including hardware-induced degradation, irregular sparsity, and realistic noise distributions. Trained entirely on synthetic data, our model achieves strong zero-shot generalization across 6 datasets and 3 real dToF devices, outperforming state-of-the-art approaches in both accuracy and computational efficiency. This establishes a robust and practical solution for dense metric depth completion from sparse direct ToF sensors. Our code and models are open-sourced. See https://vclab.kaist.ac.kr/cvpr2026p3.