RDVSv2: A Large-scale Benchmark for RGB-D Video Salient Object Detection
作者: Tianyu Li, Jiahao He, Keren Fu, Qijun Zhao
分类: cs.CV
发布日期: 2026-07-28
备注: Accepted to ACMMM 2026
🔗 代码/项目: GITHUB
💡 一句话要点
提出RDVSv2以解决RGB-D视频显著目标检测数据集不足问题
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)
关键词: RGB-D视频 显著目标检测 数据集构建 多模态融合 深度学习
📋 核心要点
- 现有RGB-D视频显著目标检测数据集规模小、注释质量低,且深度线索几何一致性差,限制了研究进展。
- RDVSv2通过从公开立体视频中构建,提供249个视频序列和29,077个高质量注释帧,解决了数据集不足的问题。
- 实验结果表明,RDVSv2对现有方法具有更高的挑战性,且基于SAM2的基线在多个基准上达到了最先进的性能。
📝 摘要(中文)
我们介绍了RDVSv2,这是一个大规模的RGB-D视频显著目标检测基准,具有密集的帧级注释。现有的数据集在规模和注释质量上往往有限,同时依赖于几何一致性较差的深度线索。为了解决这些问题,RDVSv2基于公开的立体在线视频构建,包含249个视频序列和29,077个注释帧。它包括从立体视频中提取的深度图,以及基于眼动追踪指导的帧级显著目标掩码注释。与现有数据集相比,RDVSv2在规模上更大,涵盖了更多样化和具有挑战性的场景。此外,我们基于Segment Anything Model 2 (SAM2)建立了RGB-D VSOD的强基线。具体而言,我们采用了参数高效微调(PEFT)策略,将SAM2编码器适配为联合编码RGB、深度和光流线索。大量实验表明,RDVSv2对现有RGB-D VSOD方法具有显著挑战性。同时,所提出的基线在RDVSv2和现有RGB-D VSOD基准上达到了最先进的结果。我们希望RDVSv2及提供的基线能为未来RGB-D VSOD及相关多模态视频理解任务的研究提供有用资源。
🔬 方法详解
问题定义:本论文旨在解决RGB-D视频显著目标检测领域中现有数据集规模小、注释质量低以及深度线索几何一致性差的问题。
核心思路:通过构建RDVSv2数据集,利用公开的立体视频资源,提供更大规模和更高质量的注释,以支持RGB-D VSOD的研究。
技术框架:RDVSv2包含249个视频序列,提供29,077个帧级注释,结合深度图和显著目标掩码,采用SAM2模型进行基线建立,使用PEFT策略进行参数高效微调。
关键创新:RDVSv2在规模和多样性上显著超越现有数据集,且通过引入眼动追踪指导的注释方式,提升了注释的准确性和实用性。
关键设计:在模型设计上,采用SAM2作为基础,通过PEFT策略适配RGB、深度和光流信息,确保了模型在多模态信息融合上的有效性。实验中使用了标准的损失函数和优化策略,以确保模型性能的提升。
🖼️ 关键图片
📊 实验亮点
实验结果显示,基于RDVSv2的数据集,所提出的基线模型在多个RGB-D VSOD基准上达到了最先进的性能,显著提升了检测准确率,具体性能数据未详细提供,但相较于现有方法有明显的提升幅度。
🎯 应用场景
该研究的潜在应用领域包括计算机视觉、机器人导航、智能监控等,能够帮助系统更好地理解复杂场景中的显著目标。未来,RDVSv2及其基线模型将为多模态视频理解任务提供重要的研究基础,推动相关技术的发展。
📄 摘要(原文)
We introduce RDVSv2, a large-scale benchmark for RGB-D video salient object detection (RGB-D VSOD) with dense frame-level annotations. Existing datasets in this emerging field are often limited in scale and annotation quality, while also relying on less geometry-consistent depth cues. To address these limitations, RDVSv2 is built from publicly accessible stereoscopic online videos and contains 249 video sequences with 29,077 annotated frames. It includes depth maps derived from stereoscopic videos, together with frame-wise salient object masks annotated with eye-tracking guidance. Compared with existing datasets, RDVSv2 is much larger in scale and covers more diverse and challenging scenarios. In addition, we establish a strong baseline for RGB-D VSOD based on Segment Anything Model 2 (SAM2). Specifically, we employ a parameter-efficient fine-tuning (PEFT) strategy to adapt the SAM2 encoder to jointly encode RGB, depth, and optical flow cues. Extensive experiments show that RDVSv2 is substantially more challenging for existing RGB-D VSOD methods. Meanwhile, the proposed baseline achieves state-of-the-art results on RDVSv2 and existing RGB-D VSOD benchmarks. We hope that RDVSv2 and the provided baseline will serve as useful resources for future research on RGB-D VSOD and related multi-modal video understanding tasks. Our dataset and code will be available at https://github.com/ltynick/RDVSv2.