Beyond Similarity Matching: Structured Reasoning for Open-Vocabulary Referring Segmentation in 3DGS
作者: Yizhao Wang, Xinfa Wang, Jingbo Wang, Jingbo Wang, Guantao Zhang, Yafeng Han, Guohong Gao, Yuhe Xia
分类: cs.CV
发布日期: 2026-08-17
备注: 24 pages, 5 figures
🔗 代码/项目: GITHUB
💡 一句话要点
提出QAGaussian以解决3DGS中的开放词汇指向分割问题
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics) 支柱七:动作重定向 (Motion Retargeting) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 开放词汇分割 3D高斯点云 神经推理 语言引导 关系感知图 多尺度学习 自适应路由
📋 核心要点
- 现有3DGS方法在处理涉及属性和空间关系的查询时存在目标-参考混淆和粒度不匹配等问题。
- QAGaussian通过查询条件的多尺度高斯槽和关系感知槽图,提供了一种新的语言引导高斯原语选择方法。
- QAGaussian在多个基准测试中取得了47.2的平均mIoU和63.2的平均F1,超越了最强基线2.7 mIoU和2.9 F1点。
📝 摘要(中文)
开放词汇指向分割在3D高斯点云(3DGS)中要求神经模型根据自由形式的语言表达选择高斯原语。现有基于3DGS的方法通常依赖于全局文本-区域相似性,这在涉及属性、参考对象、空间关系和细粒度部分的查询时表现较弱,导致目标-参考混淆、粒度不匹配、部分-整体泄漏和关系违反。为此,本文提出了QAGaussian,一个查询自适应的神经推理框架,用于语言引导的高斯原语选择。QAGaussian通过学习查询条件的多尺度高斯槽作为可微候选者,并构建语言条件的边加权关系感知槽图,以传播目标-参考、属性、部分-整体和上下文证据。实验结果表明,QAGaussian在多个基准测试中表现优异,显著提高了分割精度。
🔬 方法详解
问题定义:本文旨在解决开放词汇指向分割在3DGS中的挑战,现有方法在处理复杂查询时表现不佳,导致混淆和不一致性。
核心思路:QAGaussian通过查询自适应的多尺度高斯槽和关系感知的图推理,增强了模型对语言表达的理解和响应能力,旨在提高选择的准确性和一致性。
技术框架:该框架包括查询条件的多尺度高斯槽学习、关系感知槽图构建、以及自适应路由模块,最终通过关系约束进行精细化调整。
关键创新:QAGaussian的主要创新在于其查询条件的多尺度学习和关系感知的图推理,这与传统的全局相似性方法形成鲜明对比,显著提升了模型的推理能力。
关键设计:模型的关键设计包括多尺度高斯槽的可微学习、语言条件的边加权机制,以及自适应路由策略,确保了在不同粒度上对目标的有效选择和处理。
🖼️ 关键图片
📊 实验亮点
QAGaussian在多个基准测试中表现优异,平均mIoU达到47.2,平均F1达到63.2,相较于最强基线分别提升了2.7 mIoU和2.9 F1点,同时在部分-整体和关系的处理上也有显著改善,表明其有效性。
🎯 应用场景
该研究在计算机视觉和自然语言处理交叉领域具有广泛的应用潜力,尤其是在机器人视觉、自动驾驶、增强现实等场景中,能够实现更为精确的目标识别和分割,提升人机交互的智能化水平。
📄 摘要(原文)
Open-vocabulary referring segmentation in 3D Gaussian Splatting (3DGS) requires a neural model to select Gaussian primitives according to free-form language expressions. Existing 3DGS-based methods usually rely on global text-region similarity, which is weak for queries involving attributes, reference objects, spatial relations, and fine-grained parts. This often causes target-reference confusion, granularity mismatch, part-whole leakage, and relation violations. We propose QAGaussian, a query-adaptive neural reasoning framework for language-guided Gaussian primitive selection. QAGaussian first learns query-conditioned multi-scale Gaussian slots as differentiable candidates whose receptive fields are shaped by the input expression. It then builds a relation-aware slot graph with language-conditioned edge weighting to propagate target-reference, attribute, part-whole, and contextual evidence. A granularity-adaptive router softly combines region-level, object-level, part-level, attribute-aware, and relation-aware mask branches, followed by relation-constrained refinement for spatial, part-whole, attribute, and geometric consistency. QAGaussian is pretrained only on Mosaic3D-5.6M for Gaussian-text alignment and evaluated on independent benchmarks without target-dataset fine-tuning. It achieves 47.2 Avg. mIoU and 63.2 Avg. F1, outperforming the strongest 3DGS referring baseline by 2.7 mIoU points and 2.9 F1 points. It also improves Part-mIoU from 38.6 to 43.4, Rel-mIoU from 44.4 to 50.8, and reduces target-reference confusion from 10.8 to 7.4. These results demonstrate that query-conditioned slot learning, relation-aware graph reasoning, and adaptive routing provide an effective neural modeling strategy for open-vocabulary referring segmentation in 3DGS. The code is available at https://github.com/zqeslwyz/QAGaussian.