RbFT-Net: Rectify-Before-Fuse Temporal Radar Anchors for 4D Radar-Camera Depth Completion

📄 arXiv: 2608.13102v1 📥 PDF

作者: Wentao Zhao, Shouxuan Wu, Yongtao Cen, Tianchen Deng, Yuyang Zhang, Jingchuan Wang

分类: cs.CV

发布日期: 2026-08-13


💡 一句话要点

提出RbFT-Net以解决4D雷达-相机深度补全中的时序对齐问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 深度补全 雷达-相机融合 时序校正 多模态学习 自主系统

📋 核心要点

  1. 现有方法在处理雷达测量时,容易受到时序错位和动态物体干扰的影响,导致深度预测不准确。
  2. RbFT-Net提出了一种“先校正后融合”的框架,通过校正雷达锚点的位置和深度,提高深度补全的可靠性。
  3. 实验结果显示,RbFT-Net在ZJU-4DRadarCam和新收集的4D雷达-相机-LiDAR数据集上表现优异,超越了多种基线方法。

📝 摘要(中文)

从相机和毫米波雷达进行密集度量深度预测为自主系统提供了一种具有成本效益的传感解决方案。然而,雷达测量本质上稀疏且易受杂波、多路径反射和投影误差的影响。虽然聚合多个雷达帧可以提供更密集的度量线索,但也会引入时序错位和动态物体干扰。为了解决这一问题,本文提出了RbFT-Net,一个端到端的“先校正后融合”框架,用于多帧4D雷达-相机深度补全。该方法将雷达返回视为噪声时序锚点,通过图像条件校正模块共同修正其图像平面位置和度量深度,同时估计逐点可靠性。经过校正的锚点在高层次的多模态融合之前被选择性传播,从而抑制不可靠测量的影响。实验结果表明,RbFT-Net在多个数据集上均优于独立的雷达-相机方法,并与使用辅助单目深度模型的插件管道保持竞争力。

🔬 方法详解

问题定义:本文旨在解决多帧4D雷达-相机深度补全中的时序错位和动态物体干扰问题。现有方法在聚合雷达测量时,容易受到噪声和不可靠数据的影响,导致深度图的广泛区域被污染。

核心思路:RbFT-Net的核心思路是将雷达返回视为噪声时序锚点,通过图像条件校正模块修正其位置和深度,并在融合前选择性传播可靠的锚点,从而提高深度预测的准确性。

技术框架:RbFT-Net的整体架构包括图像条件校正模块和高层次多模态融合模块。校正模块负责修正雷达锚点的图像平面位置和度量深度,并评估其可靠性,而融合模块则将校正后的锚点与相机数据进行有效结合。

关键创新:RbFT-Net的主要创新在于其“先校正后融合”的策略,通过对雷达锚点进行校正,显著减少了不可靠测量对深度预测的影响。这一策略与传统方法直接融合雷达和相机数据的方式有本质区别。

关键设计:在设计上,RbFT-Net采用了图像条件校正模块,该模块使用深度学习网络来估计锚点的可靠性,并通过损失函数优化校正效果。此外,网络结构经过精心设计,以确保在处理多帧数据时的高效性和准确性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在ZJU-4DRadarCam和新收集的4D雷达-相机-LiDAR数据集上,RbFT-Net在深度预测精度上显著优于多种独立的雷达-相机方法,且与使用辅助单目深度模型的插件管道相比,保持了竞争力。具体性能数据表明,RbFT-Net在多个评估指标上均有明显提升。

🎯 应用场景

该研究的潜在应用领域包括自动驾驶、机器人导航和智能监控等。通过提高雷达和相机数据的融合精度,RbFT-Net能够为自主系统提供更可靠的环境感知能力,进而提升其决策和控制性能。未来,该方法可能在更广泛的传感器融合任务中发挥重要作用。

📄 摘要(原文)

Dense metric depth prediction from cameras and millimeter-wave radar offers a cost-effective sensing solution for autonomous systems. However, radar measurements are inherently sparse and susceptible to clutter, multipath reflections, and projection errors. While aggregating multiple radar frames provides denser metric cues, it also introduces temporal misalignment and dynamic-object interference. Directly propagating such unreliable measurements can therefore corrupt large regions of the predicted depth map. To address this issue, we propose RbFT-Net, an end-to-end rectify-before-fuse framework for multi-frame 4D radar-camera depth completion. Rather than assuming accumulated radar returns to be accurate, RbFT-Net treats them as noisy temporal anchor candidates. An image-conditioned rectification module jointly corrects their image-plane locations and metric depths while estimating pointwise reliability. The rectified anchors are then selectively propagated before high-level multi-modal fusion, suppressing the influence of unreliable measurements. Experiments on ZJU-4DRadarCam and a newly collected 4D radar-camera-LiDAR dataset show that RbFT-Net consistently outperforms the evaluated independent radar-camera methods and remains competitive with plug-in pipelines using auxiliary monocular depth models. Cross-platform evaluation and component analyses further support the effectiveness of the proposed rectification and reliability-aware propagation strategy.