SeqAlign3DVG: A Sequence-Aligned Benchmark and Voxel Reasoning Framework for 3D Visual Grounding

📄 arXiv: 2608.30451v1 📥 PDF

作者: Yi Zhang, Yi Wang, Yueting Wu, Kaiyue Yang, Yuejiao Su, Lap-Pui Chau

分类: cs.CV

发布日期: 2026-08-31

备注: Accepted by ACM Multimedia 2026 (MM '26)


💡 一句话要点

提出SeqAlign3DVG以解决图像基础3D视觉定位的时序对齐问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 3D视觉定位 时序对齐 体素记忆 语言-体素融合 多视图证据 复杂关系 智能体导航

📋 核心要点

  1. 现有的3D视觉定位基准在文本与观察的对齐上存在松散问题,且未考虑时间顺序,导致定位精度不足。
  2. SeqAlign3DVG通过引入严格的观察对齐和时序排序,确保所有表达均经过人工验证,提升了基准的可靠性。
  3. 在深度无关协议下,我们的方法显著提高了复杂关系和外观线索定义目标的定位性能,达到了当前最优水平。

📝 摘要(中文)

基于图像的3D视觉定位对于具身智能体至关重要,但现有基准在文本与观察的对齐上存在不足,并忽视了时间顺序。我们引入SeqAlign3DVG,这是一个专门针对时序有序和严格观察对齐的图像基础3D视觉定位的新基准。与以往使用无序视图或全局点云的方法不同,SeqAlign3DVG确保所有表达均经过人工验证,并严格基于提供的RGB观察(单帧或有序观察序列)。该基准包含9622个单视图样本和14493个序列样本,具有丰富的描述、复杂的关系和多实例歧义。为应对这一基准,我们提出了一个统一的基于体素的管道,包含相关性有序体素记忆(ROVM)和渐进语言-体素融合(PLVF)。

🔬 方法详解

问题定义:本论文旨在解决现有图像基础3D视觉定位基准在文本与观察对齐松散及时间顺序忽视的问题,导致定位精度不足。

核心思路:我们提出SeqAlign3DVG基准,确保所有表达经过人工验证,并严格基于RGB观察,结合相关性有序体素记忆(ROVM)和渐进语言-体素融合(PLVF)方法,提升定位精度。

技术框架:整体架构包括两个主要模块:ROVM用于动态排名和聚合多视图证据,PLVF则进行空间-语言的精细推理,确保对复杂关系的准确解歧。

关键创新:ROVM通过保守记忆动态处理多视图信息,减少噪声影响,而PLVF则采用粗到细的推理策略,显著提升了定位精度,与现有方法相比具有本质区别。

关键设计:在参数设置上,ROVM和PLVF的设计考虑了多视图证据的整合和语言信息的逐步融合,确保了模型在复杂场景下的有效性。具体损失函数和网络结构细节在论文中进行了详细描述。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

我们的实验结果显示,在深度无关协议下,SeqAlign3DVG方法在复杂关系和外观线索定义目标的定位任务中,性能显著提升,超越了现有基线,达到了当前最优水平。

🎯 应用场景

该研究的潜在应用领域包括机器人导航、增强现实和智能监控等,能够为具身智能体提供更准确的环境理解和交互能力。未来,SeqAlign3DVG有望推动3D视觉定位技术的进一步发展,提升智能体在复杂场景中的表现。

📄 摘要(原文)

Image-based 3D visual grounding is critical for embodied agents, yet existing benchmarks suffer from loose text-observation alignment and neglect temporal ordering. We introduce SeqAlign3DVG, a novel benchmark dedicated to temporally ordered and strictly observation-aligned image-based 3D visual grounding. Unlike prior works using order-agnostic views or global point clouds, SeqAlign3DVG ensures all expressions are human-verified and strictly grounded in the provided RGB observations (single frames or ordered observation sequences). It comprises 9,622 single-view and 14,493 sequence samples featuring rich descriptions, complex relations, and multi-instance ambiguities. To tackle this benchmark, we propose a unified voxel-based pipeline featuring Relevance-Ordered Voxel Memory (ROVM) and Progressive Language-Voxel Fusion (PLVF). ROVM dynamically ranks and aggregates multi-view evidence via a conservative memory to mitigate noisy observations, while PLVF performs coarse-to-fine spatial-linguistic reasoning for precise disambiguation. Our approach achieves state-of-the-art performance under the depth-free protocol, significantly improving localization for targets defined by complex relations and appearance cues.