Bootstrapping a 4D LiDAR Annotation Tool from Video Foundation Models
作者: Jihun Kim, Hyun-Kurl Jang, Hyemin Yang, Jinnyeong Yang, Hyeokjun Kweon, Kuk-Jin Yoon
分类: cs.CV
发布日期: 2026-08-26
备注: ECCV 2026 Workshop
💡 一句话要点
提出LiDAR-SAM2以解决4D LiDAR标注数据不足问题
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 4D LiDAR 自动标注 视频基础模型 时空聚合 语义分割 深度学习 多模态学习
📋 核心要点
- 现有方法在4D LiDAR分割中面临数据不足的问题,人工标注成本高且难以扩展。
- 论文提出LiDAR-SAM2框架,利用2D视频模型SAM2自动生成时间一致的LiDAR标签,降低人工干预。
- 实验结果表明,LiDAR-SAM2生成的标签接近全人工标注质量,且在模型训练中表现出色,接近全真值监督性能。
📝 摘要(中文)
4D LiDAR分割的进展受到数据瓶颈的制约,跨稀疏点云序列分配时间一致的标签既昂贵又难以扩展。为此,本文提出LiDAR-SAM2框架,将2D视频基础模型SAM2转化为4D LiDAR领域的可扩展监督源。该框架通过多视角投影和时空聚合自动生成时间一致的LiDAR级标签,并通过定制的模态接口和两阶段学习目标,使SAM2的视频分割内核适应时空LiDAR结构。LiDAR-SAM2在没有人工LiDAR标注的情况下,能够在SemanticKITTI上生成接近全人工标注质量的语义和全景标签,显著降低了3D和4D场景理解的标注负担。
🔬 方法详解
问题定义:本论文旨在解决4D LiDAR分割中数据标注不足的问题。现有方法依赖人工标注,成本高且难以扩展,尤其是在新任务或领域中需要新的密集标注。
核心思路:论文的核心思路是通过LiDAR-SAM2框架,将2D视频基础模型SAM2转化为4D LiDAR领域的监督源,从而实现自动生成高质量的LiDAR标签,减少人工标注的需求。
技术框架:LiDAR-SAM2框架包括两个主要模块:数据生成模块和模型适配模块。数据生成模块通过多视角投影和时空聚合,从SAM2视频掩膜中自动生成时间一致的LiDAR标签;模型适配模块则通过定制的模态接口和两阶段学习目标,调整SAM2的视频分割内核以适应LiDAR结构。
关键创新:最重要的技术创新在于将2D视频分割模型有效地转化为3D和4D场景理解的标签生成工具,且无需人工标注。与现有方法相比,LiDAR-SAM2显著提高了标签生成的效率和一致性。
关键设计:在设计中,采用了定制的损失函数以优化标签生成的准确性,并通过两阶段学习目标来增强模型对时空结构的适应性。网络结构上,结合了多视角信息以提升标签的一致性和质量。
🖼️ 关键图片
📊 实验亮点
实验结果显示,LiDAR-SAM2在SemanticKITTI数据集上生成的语义和全景标签质量接近全人工标注,且在模型训练中表现出色,接近全真值监督的性能。这表明该方法在标注效率和质量上具有显著提升,能够有效降低标注负担。
🎯 应用场景
该研究的潜在应用领域包括自动驾驶、机器人导航和城市建模等。通过减少对人工标注的依赖,LiDAR-SAM2能够加速4D场景理解的研究和应用,提升相关技术的普及和发展。未来,该框架可能为更多领域的自动标注提供新的思路和方法。
📄 摘要(原文)
Progress in 4D LiDAR segmentation is bottlenecked by data. Assigning temporally consistent labels across sparse point cloud sequences is costly and hard to scale, and every new task or domain tends to demand fresh dense annotation. This motivates a simple question of whether high-quality LiDAR training data can be produced automatically, without any human labeling. To this end, we introduce LiDAR-SAM2, a framework that turns a 2D video foundation model, SAM2, into a scalable source of supervision for the 4D LiDAR domain. On the data side, it automatically generates temporally coherent LiDAR-level labels from SAM2 video masks through multi-view projection and spatio-temporal aggregation. On the modeling side, a tailored modality interface and a two-stage learning objective adapt SAM2's video segmentation kernel to spatio-temporal LiDAR structure, so that a single click per object yields a consistent mask track across the sequence. Trained with no human LiDAR annotation, LiDAR-SAM2 produces semantic and panoptic labels on SemanticKITTI that approach the quality of full human annotation from only a few points, and models trained on these labels approach the performance of full ground-truth supervision. This positions LiDAR-SAM2 as a scalable labeling tool that substantially reduces the annotation burden for 3D and 4D scene understanding.