STAR: A Spatial-Topology Aware Routing Framework for Generalizable 3D Scene Understanding
作者: Mingwei Xing, Xinliang Wang, Yifeng Shi
分类: cs.CV
发布日期: 2026-08-12
备注: The third author is the corresponding author
🔗 代码/项目: PROJECT_PAGE
💡 一句话要点
提出STAR框架以解决多模态3D场景理解中的拓扑差异问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱三:空间感知与语义 (Perception & Semantics)
关键词: 3D场景理解 多模态学习 混合专家 自监督学习 拓扑感知 动态分配 语义一致性 几何异质性
📋 核心要点
- 现有的多模态3D场景理解方法在处理传感器模态间的拓扑差异时存在显著不足,导致模型性能受限。
- 本文提出的STAR框架通过引入多属性自监督预训练和域感知专家分支,解决了语义一致性与几何异质性共存下的专家分配问题。
- 实验结果显示,STAR在ScanNet和S3DIS数据集上分别取得80.1%和77.2%的mIoU,显著提升了模型的理解能力。
📝 摘要(中文)
构建统一的3D场景理解模型长期受到传感器模态间拓扑差异的阻碍。尽管混合专家(MoE)架构为多领域3D理解提供了灵活的解决方案,但传统的仅基于特征的MoE路由器在语义监督下可能无法充分表示局部采样拓扑,从而使得在语义一致性与几何异质性共存时的专家分配变得困难。为此,本文提出了STAR(空间-拓扑感知路由框架)。我们引入了一个多属性自监督预训练分支,涵盖拓扑和纹理变化,以锚定跨域结构先验。基于此,我们设计了一个域感知专家分支,包含两个机制:域-空间引导路由(DSR)和熵控制动态分配(EDA),前者捕捉空间上下文中的局部拓扑变化,后者根据路由不确定性调整激活专家的数量。大量实验表明,STAR在多个任务上表现出色,在ScanNet验证集上达到80.1%的mIoU,在S3DIS上达到77.2%的mIoU,持续超越强基线。
🔬 方法详解
问题定义:本文旨在解决多模态3D场景理解中由于传感器模态间拓扑差异导致的模型性能不足问题。现有方法在语义监督下的局部采样拓扑表示不足,影响了专家的有效分配。
核心思路:STAR框架通过引入多属性自监督预训练分支,结合域感知专家分支,旨在稳定跨域表示学习并实现自适应的专家分配,从而提高模型的泛化能力。
技术框架:STAR框架主要由两个分支组成:多属性自监督预训练分支和域感知专家分支。前者用于锚定跨域结构先验,后者则通过域-空间引导路由(DSR)和熵控制动态分配(EDA)机制实现专家的动态分配。
关键创新:STAR的核心创新在于引入了DSR和EDA机制,使得模型能够根据空间上下文捕捉局部拓扑变化,并根据路由的不确定性动态调整激活的专家数量,这在现有方法中尚属首次。
关键设计:在设计中,采用了多属性自监督学习策略,损失函数结合了语义和几何信息,网络结构则通过引入空间上下文信息增强了局部特征的表达能力。整体架构保证了模型在不同场景下的稳定性和适应性。
🖼️ 关键图片
📊 实验亮点
STAR框架在ScanNet验证集上取得了80.1%的mIoU,在S3DIS上达到了77.2%的mIoU,均显著优于现有强基线,展示了其在多模态3D场景理解中的有效性和优势。
🎯 应用场景
该研究的潜在应用领域包括智能城市、自动驾驶、机器人导航等,能够为3D场景理解提供更为准确和一致的模型,提升相关技术的实际应用价值。未来,STAR框架有望推动多模态学习和跨域适应的进一步发展。
📄 摘要(原文)
Constructing a unified 3D scene understanding model has long been hindered by the topological discrepancies across sensor modalities. While applying the Mixture-of-Experts (MoE) architecture is a flexible approach for multi-domain 3D understanding, we observe that conventional feature-only MoE routers may underrepresent local sampling topology under semantic supervision, making expert allocation difficult when semantic consistency coexists with geometric heterogeneity. To overcome this challenge, we propose STAR (Spatial-Topology Aware Routing Framework). Specifically, we introduce a multi-attribute self-supervised pre-training branch, covering topological and textural variations, to anchor cross-domain structural priors. Building upon this, we design a domain-aware expert branch with two mechanisms: Domain-Spatial-Guided Routing (DSR), which captures local topological variations from spatial context, and Entropy-controlled Dynamic Allocation (EDA), which adjusts the number of activated experts according to routing uncertainty. Together, these branches combine stable cross-domain representation learning with adaptive expert allocation. Extensive experiments across various tasks, encompassing both indoor and outdoor scenes, demonstrate the effectiveness of STAR. It achieves 80.1% mIoU on the ScanNet validation set and 77.2% mIoU on S3DIS, consistently improving over strong baselines. Code is available at our project page (https://xmw666.github.io/STAR/).