Seed2GS: Camera-Free, Training-Free Object Extraction from 3D Gaussian Scenes via a Single Reference-View Grounding
作者: Zongjian Ding, Yudong Gao, Jiale Liu, Xinglin Yu, Junxing Ren, Dong Wei, Yajing Chen, Shan Huang, Mingjun Cheng, Min Li
分类: cs.CV
发布日期: 2026-08-12
💡 一句话要点
提出Seed2GS以解决无摄像机、无训练的3D物体提取问题
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)
关键词: 3D物体提取 高斯场景 无训练方法 交互式编辑 计算机视觉 虚拟现实 增强现实
📋 核心要点
- 现有方法在3D物体提取中面临训练时间长、准确性低或依赖于特定摄像机等挑战。
- Seed2GS通过将目标身份与3D覆盖分离,提出了一种无需训练和摄像机的提取方法。
- 在LERF-MASK上,Seed2GS达到了92.1%的mIoU,超越了最强基线3.7个百分点,展现了显著的性能提升。
📝 摘要(中文)
本研究提出Seed2GS方法,旨在从预构建的3D高斯场景中提取目标物体,以实现交互式3D编辑。现有方法通常需要数十分钟的训练时间,或牺牲准确性,或依赖于原始重建摄像机,而Seed2GS则无需这些条件。其核心思想是将目标身份与3D覆盖分离,通过QD-SAM3选择一个可靠的参考掩码,并利用种子提升和适应性虚拟轨道从新视角展示物体。实验结果表明,Seed2GS在LERF-MASK上达到了92.1%的平均交并比(mIoU),并且计算延迟为9.3秒,显著优于现有基线。
🔬 方法详解
问题定义:本论文旨在解决从预构建的3D高斯场景中提取目标物体的问题。现有方法通常需要长时间训练,或依赖于特定的摄像机,这限制了其应用场景。
核心思路:Seed2GS的核心思路是将目标身份与3D覆盖分离,避免了对原始重建摄像机和场景特定表示训练的依赖。通过选择一个可靠的参考掩码,固定目标身份,进而实现高效的物体提取。
技术框架:Seed2GS的整体架构包括几个主要模块:首先,使用QD-SAM3选择一个可靠的参考掩码;然后,通过种子提升和适应性虚拟轨道从不同视角展示物体;最后,利用跟踪机制传播种子,避免重复检测。
关键创新:Seed2GS的主要创新在于其无需训练和摄像机的设计,显著提高了物体提取的准确性和效率。这一方法在处理3D场景时,能够有效地分离目标身份与3D覆盖。
关键设计:在设计中,Seed2GS采用了适应性虚拟轨道和跟踪机制,以确保在不同视角下的物体展示。同时,针对每个高斯,掩码仅监督一个临时前景logit,从而提高了计算效率。实验中,使用固定的测试参考掩码,保持了91.1%的mIoU。
🖼️ 关键图片
📊 实验亮点
Seed2GS在LERF-MASK上达到了92.1%的mIoU,计算延迟仅为9.3秒,超越了最强场景训练基线3.7个百分点,并且在3D-OVS上也达到了95.7%的mIoU,展现了其优越的性能。
🎯 应用场景
Seed2GS在交互式3D编辑、虚拟现实和增强现实等领域具有广泛的应用潜力。其高效的物体提取能力可以为游戏开发、影视制作和工业设计等行业提供更灵活的工具,推动3D内容创作的进步。
📄 摘要(原文)
Extracting a target object from a pre-built 3D Gaussian Splatting (3DGS) scene enables interactive 3D editing. Existing methods either train for tens of minutes per scene, sacrifice accuracy, or require original reconstruction cameras that pre-built assets may not include. We present Seed2GS, which achieves the highest reported LERF-MASK accuracy without original reconstruction cameras or scene-specific representation training. Its key insight is to separate target identity from 3D coverage. QD-SAM3 selects one reliable reference mask from several open-vocabulary candidates, fixing identity once. Seed lift and visibility-adaptive virtual orbits then expose the object from new viewpoints, while tracking propagates the seed without repeated detection. Because the scene remains frozen, these masks supervise only one temporary foreground logit per Gaussian. On LERF-MASK, Seed2GS reaches 92.1% mean intersection over union (mIoU) with a measured compute-only latency of 9.3 seconds, 3.7 points above the strongest scene-trained baseline and 7.6 points above the closest camera-free baseline. With one fixed test reference per scene, the complete pipeline retains 91.1% mIoU; replacing its predicted seed with a ground-truth mask improves mIoU by only 0.72 points. On 3D-OVS, Seed2GS reaches 95.7% mIoU.