UniQuery4R: Unified 4D Scene Reconstruction from a Single Query

📄 arXiv: 2608.17283v1 📥 PDF

作者: Tiancheng Chen, Sheng Tang, Wenhua Jin, Weiqi Zhang, Juntong Fang, Junsheng Zhou, Zesong Li

分类: cs.CV

发布日期: 2026-08-18

备注: 16 pages, 8 figures. Project page: https://kosmoresearch.github.io/UniQuery4R/


💡 一句话要点

提出UniQuery4R以解决动态4D场景重建问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 动态场景重建 4D重建 查询条件框架 场景流估计 机器人导航 增强现实

📋 核心要点

  1. 现有方法在动态4D场景重建中存在计算冗余和特征重用不足的问题,限制了性能。
  2. UniQuery4R通过查询条件框架,优化了多帧片段的编码和源-目标选择,提升了重建效率。
  3. 在WorldTrack评估中,UniQuery4R在场景流估计和动态点重建上均取得了最佳结果,显示出显著的性能提升。

📝 摘要(中文)

动态4D场景重建需要联合估计对应关系、几何形状、物体运动和相机运动。现有的前馈方法通常预测密集的特定任务地图或独立处理源-目标对,导致稀疏查询的计算冗余和不同帧对之间特征重用的限制。本文提出了UniQuery4R,一个查询条件框架,通过源到目标的交叉注意力机制,在解码时选择源视图、目标视图和连续源图像坐标。每个查询联合预测目标对应关系、目标时间的3D位置和场景流,同时估计每个视图的相机参数。这种设计允许编码的片段在任意源-目标选择中重用,并支持稀疏推理和密集重建,而不依赖于固定片段长度的学习时间嵌入。我们进一步引入了场景流的方向-幅度参数化,并对移动和静态点进行单独监督。在评估的方法中,UniQuery4R在WorldTrack上实现了场景流估计和动态点重建的最佳宏平均结果。

🔬 方法详解

问题定义:本文旨在解决动态4D场景重建中的多个挑战,包括对应关系、几何形状、物体运动和相机运动的联合估计。现有方法往往导致计算冗余和特征重用不足,影响重建效率和准确性。

核心思路:UniQuery4R提出了一种查询条件框架,通过一次性编码多帧片段,并在解码时选择源视图和目标视图,从而优化了计算过程。这种设计使得编码片段可以在不同的源-目标选择中重用,支持稀疏推理和密集重建。

技术框架:该方法的整体架构包括多个模块:首先对多帧片段进行编码,然后通过源到目标的交叉注意力机制选择视图和坐标,最后联合预测目标对应关系、3D位置和场景流。相机参数在每个视图中单独估计。

关键创新:UniQuery4R的主要创新在于其查询条件框架和场景流的方向-幅度参数化,允许对移动和静态点进行单独监督。这与现有方法的固定片段长度和学习时间嵌入的设计形成了鲜明对比。

关键设计:在技术细节上,UniQuery4R采用了交叉注意力机制来选择源-目标视图,并设计了适应性损失函数以优化场景流的估计。此外,网络结构支持灵活的查询输入,增强了模型的通用性和适应性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在WorldTrack评估中,UniQuery4R在场景流估计和动态点重建方面取得了最佳的宏平均结果,显示出相较于其他方法的显著性能提升,具体数据未提供。

🎯 应用场景

该研究在动态场景重建、增强现实、机器人导航等领域具有广泛的应用潜力。通过提高重建效率和准确性,UniQuery4R可以为实时场景理解和交互提供更强大的支持,推动相关技术的发展和应用。

📄 摘要(原文)

Reconstructing dynamic 4D scenes requires jointly estimating correspondence, geometry, object motion, and camera motion. Existing feed-forward methods typically predict dense task-specific maps or independently process source-target pairs, leading to unnecessary computation for sparse queries and limited feature reuse across different frame pairs. We present UniQuery4R, a query-conditioned framework that encodes a multi-frame clip once and selects the source view, target view, and continuous source-image coordinate only at decoding time via source-to-target cross-attention. Each query jointly predicts target correspondence, target-time 3D position, and scene flow, along with source depth, while camera parameters are estimated per view. This design allows the encoded clip to be reused across arbitrary source-target selections and supports both sparse inference and dense reconstruction through batched queries, without learned temporal embeddings tied to a fixed clip length. We further introduce a direction-magnitude parameterization of scene flow with separate supervision for moving and static points. Among the evaluated methods, UniQuery4R achieves the best macro-average results on WorldTrack for both scene-flow estimation and dynamic-point reconstruction.