OVIP-SG: Open-Vocabulary Instance-Preserving Scene Graphs for Mapping and Retrieval of Small, Fine-Grained Objects
作者: Tianjing Hao, Haiyu Lan, Angsong Li, Cheng Chen, Enyu Li, Jiarui Yang, Yuning Su, Peiwen Lin, Wang Chuang
分类: cs.RO
发布日期: 2026-08-18
备注: 15 pages, 6 figures, including appendix
💡 一句话要点
提出OVIP-SG以解决开放词汇感知下小物体映射与检索问题
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)
关键词: 开放词汇感知 3D场景图 小物体检索 实例保持 视觉-语言模型 机器人导航 语义映射
📋 核心要点
- 现有方法在开放词汇感知下,容易导致大表面碎片化和小物体合并,影响实例一致性和映射精度。
- OVIP-SG通过视觉-语言模型实现稳健的开放世界检测,并采用对称3D IoU关联和面积加权特征融合来保持小物体实例。
- 在Replica数据集上,OVIP-SG在类均准确率和频率加权mIoU上显著优于ConceptGraphs,且在物体存在分类上达到0.773的平衡准确率。
📝 摘要(中文)
将开放词汇感知整合到对象级3D场景图中是一把双刃剑。尽管视觉-语言检测器能够恢复长尾类别和被封闭模型忽视的小物体,但它们也可能导致大表面的碎片化和小物体的合并,从而影响实例级一致性和映射的准确性。此外,现有方法在检索未映射目标或判断查询对象是否缺失方面存在困难,阻碍了稳健的开放世界导航与探索。为此,本文提出了OVIP-SG,一个统一的框架,用于实例保持的语义映射、功能场景划分和语言引导的小物体检索。OVIP-SG利用视觉-语言模型(VLM)枚举场景特定类别以实现稳健的开放世界检测。对称3D交并比(IoU)关联和面积加权特征融合保持小的独立实例,而VLM推断的对象功能将场景划分为紧凑的功能搜索区域。四阶段级联检索管道进一步结合体素投票,确定目标缺失。OVIP-SG在Replica上的统一评估协议下,类均准确率(mAcc)比ConceptGraphs提高了6.31分,频率加权mIoU(F-mIoU)提高了5.15分,同时实现了0.398的类无关原生实例全景质量(PQ)。
🔬 方法详解
问题定义:本文旨在解决开放词汇感知下小物体的映射与检索问题,现有方法在处理长尾类别时容易导致实例不一致和映射精度下降。
核心思路:OVIP-SG通过引入视觉-语言模型(VLM)来增强场景特定类别的检测能力,同时采用对称3D IoU关联和面积加权特征融合技术,以保持小物体的独立性。
技术框架:OVIP-SG的整体架构包括三个主要模块:实例保持的语义映射、功能场景划分和语言引导的小物体检索。首先,VLM用于检测场景中的物体类别;其次,通过对称3D IoU关联和特征融合保持小物体实例;最后,使用四阶段级联检索管道结合体素投票来确定目标的存在性。
关键创新:OVIP-SG的主要创新在于其对称3D IoU关联和面积加权特征融合方法,这与现有方法的处理方式有本质区别,能够有效保持小物体的独立性。
关键设计:在设计上,OVIP-SG采用了特定的损失函数以优化实例保持效果,同时在特征融合阶段引入了面积加权机制,确保小物体在映射中的准确性。
🖼️ 关键图片
📊 实验亮点
OVIP-SG在Replica数据集上的实验结果显示,其类均准确率(mAcc)比ConceptGraphs提高了6.31分,频率加权mIoU(F-mIoU)提高了5.15分,且实现了0.398的类无关原生实例全景质量(PQ)。此外,OVIP-SG将搜索区域缩小至室内地面空间的21.8%,在物体存在分类上达到0.773的平衡准确率,展现出显著的性能提升。
🎯 应用场景
OVIP-SG在机器人导航、智能家居和增强现实等领域具有广泛的应用潜力。其能够有效识别和检索小型、细粒度物体,为自主系统提供更为精准的环境理解和交互能力,未来可能推动智能机器人在复杂环境中的应用。
📄 摘要(原文)
Integrating open-vocabulary perception into object-level 3D scene graphs is a double-edged sword. While vision-language detectors recover long-tail categories and small, fine-grained objects overlooked by closed-set models, they also tend to fragment large surfaces and merge small objects into larger neighboring objects, compromising instance-level consistency and undermining mapping fidelity. Moreover, existing methods struggle to retrieve previously unmapped targets or determine whether a queried object is absent, hindering robust embodied open-world navigation and exploration. We present OVIP-SG, a unified framework for instance-preserving semantic mapping, functional scene partitioning, and language-guided small, fine-grained object retrieval. OVIP-SG uses a vision-language model (VLM) to enumerate scene-specific categories for robust open-world detection. Symmetric 3D Intersection over Union (IoU) association and area-weighted feature fusion preserve small independent instances, while VLM-inferred object functions partition scenes into compact functional search regions. A four-stage cascaded retrieval pipeline further incorporates voxel voting and determines target absence from exploration coverage. Under a unified evaluation protocol on Replica, OVIP-SG outperforms ConceptGraphs by 6.31 points in class-mean accuracy (mAcc) and 5.15 points in frequency-weighted mIoU (F-mIoU) while achieving a class-agnostic native-instance Panoptic Quality (PQ) of 0.398. It reduces the search area to 21.8% of the indoor floor space and reaches 0.773 balanced accuracy for object-presence classification. Real-world robotic experiments further demonstrate its practical effectiveness.