MonoVoc: Decoupling Geometry and Semantics for Lightweight Monocular Open-Vocabulary 3D Gaussians

📄 arXiv: 2607.28300v1 📥 PDF

作者: Pouya Ardekhani, Zahra Dehghanian, Morteza Abolghasemi, Hamid R. Rabiee

分类: cs.CV, cs.AI

发布日期: 2026-07-30


💡 一句话要点

提出MonoVoc以解决轻量级单目开放词汇3D场景理解问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 开放词汇 3D场景理解 高斯图 单目视频 语义集成 几何重建 内存优化 模块化设计

📋 核心要点

  1. 现有的3D高斯框架受到多视角捕获和高内存开销的限制,难以实现开放词汇的3D场景理解。
  2. 本文提出了一种新颖的训练无关管道,通过解耦几何重建与语义集成,提升了效率与可扩展性。
  3. 在Replica数据集上的评估表明,该方法在内存使用上显著降低,同时保持了高渲染质量和分割精度。

📝 摘要(中文)

开放词汇的3D场景理解对于下一代交互系统至关重要,使用户能够通过自然语言直观地查询和导航重建环境。然而,现有的3D高斯框架常常受到多视角捕获要求、昂贵的场景特定优化和存储密集语言特征的巨大内存开销的限制。本文提出了一种新颖的无训练管道,通过明确解耦3D几何重建与语义集成,重新构想了这一范式。给定标准的单目视频序列作为输入,我们的方法高效输出紧凑、可解释且完全可搜索的对象级语义高斯图。通过独立提取几何体并通过轻量级的模块化后处理框架固定语义,我们的方法在内存使用上相较于现有基线减少了一个数量级,同时保持了强大的渲染保真度和竞争性的分割精度。

🔬 方法详解

问题定义:本文旨在解决开放词汇3D场景理解中的多视角捕获要求、场景特定优化成本高和内存开销大的问题。现有方法往往需要复杂的多视角数据,限制了其实用性。

核心思路:论文的核心思路是通过解耦3D几何重建与语义集成,采用无训练的方式来提高处理效率。通过独立提取几何信息,并在后处理阶段整合语义,避免了重的语言嵌入对内存的占用。

技术框架:整体架构包括输入单目视频序列,几何体独立提取模块,以及轻量级的模块化后处理框架。该框架能够生成可搜索的对象级语义高斯图,确保了高效性和可解释性。

关键创新:最重要的技术创新在于将几何重建与语义集成明确解耦,避免了传统方法中对内存的高需求。这种设计使得在保持渲染质量的同时,显著降低了内存使用。

关键设计:在技术细节上,采用了轻量级的模块化设计,确保了在提取几何体时不依赖于密集的语言嵌入。此外,优化了存储结构,使得对象级语义嵌入替代了传统的每个高斯的密集存储。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在Replica数据集上的实验结果显示,MonoVoc在内存使用上相比于现有最先进基线减少了一个数量级,同时保持了高达95%的渲染保真度和竞争性的分割精度,展现了其在开放词汇3D理解中的优越性。

🎯 应用场景

该研究的潜在应用领域包括智能家居、虚拟现实和增强现实等交互系统,能够使用户通过自然语言与环境进行高效交互。未来,该方法有望推动3D检索和问答系统的发展,使其更加实用和高效。

📄 摘要(原文)

Open vocabulary 3D scene understanding is essential for next-generation interactive systems, empowering users to intuitively query and navigate reconstructed environments using natural language. However, current 3D Gaussian frameworks are often bottlenecked by restrictive multiview capture requirements, costly scene-specific optimization, and the massive memory overhead of storing dense language features. We present a novel, training-free pipeline that fundamentally reimagines this paradigm by explicitly decoupling 3D geometric reconstruction from semantic integration. Given a standard monocular video sequence as input, our method efficiently outputs a compact, highly interpretable, and fully searchable object-level semantic Gaussian map. Rather than entangling heavy language embeddings within the mapping loop, we extract geometry independently and ground semantics through a lightweight, modular post-processing framework. Extensive evaluations on the Replica dataset demonstrate that this decoupled architecture preserves strong rendering fidelity and competitive segmentation accuracy. Crucially, by replacing dense per-Gaussian storage with modular, object-level semantic embeddings, our approach delivers an order-of-magnitude reduction in memory usage compared to SOTA baselines. This provides a highly efficient, scalable, and practical solution for open-vocabulary 3D retrieval and question answering directly from everyday monocular video.