CVSD-Reg: Cross-Modal Visual Semantic Prior Distillation for Robust LiDAR Registration

📄 arXiv: 2608.19536v1 📥 PDF

作者: Eunsoo Im, Junghun Suh, Gyeonggwan Lee, Seunghwan Hong

分类: cs.CV, cs.AI, cs.RO

发布日期: 2026-08-20


💡 一句话要点

提出CVSD-Reg以解决LiDAR注册的鲁棒性问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: LiDAR注册 视觉语义蒸馏 鲁棒性提升 对比学习 点云处理

📋 核心要点

  1. 现有的基于几何的点云注册方法对点密度和传感器特性变化敏感,导致鲁棒性不足。
  2. CVSD-Reg通过从视觉模型中提取语义先验,结合对比蒸馏和球面流形对齐,提升LiDAR注册的鲁棒性。
  3. 在KITTI、nuScenes和HeLiPR数据集上,CVSD-Reg的成功率显著高于现有方法,尤其在稀疏扫描情况下表现优异。

📝 摘要(中文)

基于学习的全局点云注册取得了显著进展,但现有方法对几何表示的依赖使其对点密度、扫描模式、视角和传感器特性变化敏感。本文提出CVSD-Reg,一个鲁棒的全局LiDAR注册框架,通过从视觉基础模型中提取视觉语义先验来增强LiDAR表示。在第一阶段,Point Transformer V3学生通过对比蒸馏和球面流形对齐从冻结的DINOv2教师中学习,保持教师嵌入空间的超球几何。自监督的InfoNCE一致性和软$ ext{SE}(3)$不变性进一步促进了视角鲁棒描述符。在第二阶段,蒸馏表示通过对应学习、密度感知点丢弃增强和端到端姿态优化适应注册。CVSD-Reg在KITTI、nuScenes和HeLiPR上分别实现了97.7%、99.0%和99.3%的严格成功率,超越了最先进的几何注册方法,且无需相机输入或后处理ICP优化。

🔬 方法详解

问题定义:本文旨在解决现有基于几何的LiDAR注册方法在点密度、扫描模式和传感器特性变化下的鲁棒性不足问题。现有方法对几何表示的依赖使其在不同条件下表现不稳定。

核心思路:CVSD-Reg的核心思路是通过从视觉基础模型中提取视觉语义先验,增强LiDAR表示的鲁棒性。通过对比蒸馏和球面流形对齐,保持了教师模型的超球几何特性,从而提高了视角鲁棒性。

技术框架:CVSD-Reg的整体架构分为两个阶段。第一阶段是通过对比蒸馏和球面流形对齐训练Point Transformer V3学生模型,第二阶段则通过对应学习和密度感知点丢弃增强来适应注册任务。

关键创新:最重要的创新点在于将视觉语义先验蒸馏到LiDAR表示中,且在训练过程中保持了超球几何特性,这与传统几何方法有本质区别。

关键设计:在设计中,采用了自监督的InfoNCE一致性损失和软$ ext{SE}(3)$不变性,确保了模型在不同视角下的鲁棒性。此外,密度感知点丢弃增强和端到端姿态优化进一步提升了注册效果。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

CVSD-Reg在KITTI、nuScenes和HeLiPR数据集上分别达到了97.7%、99.0%和99.3%的严格成功率,超越了最先进的几何注册方法,提升幅度最高可达44.0个百分点,且无需相机输入或后处理ICP优化,显示出其在实际应用中的强大优势。

🎯 应用场景

CVSD-Reg的研究成果在自动驾驶、机器人导航和三维重建等领域具有广泛的应用潜力。通过提高LiDAR注册的鲁棒性,该方法能够在多种传感器和环境条件下实现更高效的场景理解和数据融合,推动相关技术的进步与应用。

📄 摘要(原文)

Learning-based global point cloud registration has achieved remarkable progress, yet its reliance on geometric representations makes existing methods sensitive to variations in point density, scan pattern, viewpoint, and sensor characteristics. We propose CVSD-Reg, a robust global LiDAR registration framework that distills visual semantic priors from a vision foundation model into LiDAR representations. In Stage 1, a Point Transformer V3 student learns from a frozen DINOv2 teacher through contrastive distillation and spherical-manifold alignment, which preserves the hyperspherical geometry of the teacher embedding space. Self-supervised InfoNCE consistency and soft $\mathrm{SE}(3)$ invariance further encourage viewpoint-robust descriptors. In Stage 2, the distilled representation is adapted to registration through correspondence learning, density-aware point-dropout augmentation, and end-to-end pose optimization. With a single checkpoint, CVSD-Reg generalizes to both single-sensor and zero-shot cross-sensor scenarios without sensor-specific adaptation and remains entirely camera-free at inference. On KITTI, nuScenes, and HeLiPR, CVSD-Reg achieves strict success rate (SR@0.5\,m/$1^\circ$) of 97.7$\%$, 99.0$\%$, and 99.3$\%$, respectively, including 97.3$\%$ on sparse 16-beam Velodyne scans. It outperforms state-of-the-art geometric registration methods by up to 44.0 percentage points without requiring camera inputs or post-hoc ICP refinement.