VR3D: View-Robust 3D Representation Learning for Aerial-Ground Person Re-Identification

📄 arXiv: 2608.02598v1 📥 PDF

作者: Chao Ji, Shiyu Xuan, Zechao Li

分类: cs.CV

发布日期: 2026-08-03

备注: 12 pages, 10 figures


💡 一句话要点

提出VR3D框架以解决空中与地面行人重识别中的视角变化问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 行人重识别 三维表示学习 视角不变性 几何-语义注意力 可靠性感知融合

📋 核心要点

  1. 现有方法在二维图像空间中学习视角不变特征,但在视角变化剧烈时,特征仍受视角偏差影响,导致重识别性能下降。
  2. 本文提出VR3D框架,通过将图像映射到统一的三维坐标空间,实现视角独立的特征交互,克服了现有方法的局限性。
  3. 在CARGO数据集上,VR3D实现了5.63%的Rank-1提升,展示了其在行人重识别任务中的优越性能。

📝 摘要(中文)

空中与地面行人重识别是一项具有挑战性的任务,主要由于跨平台视角变化导致严重的遮挡和几何变形。现有方法试图在二维图像空间中学习视角不变的表示,但在剧烈的视角变化下,所学习的特征仍然与视角偏差相耦合。为了解决这一问题,本文提出了VR3D,一个视角稳健的三维表示学习框架,将图像映射到统一的三维坐标空间,以实现视角独立的特征交互。具体而言,我们引入了视角稳健的三维表示交互,利用从单个二维观测中提取的三维先验,将二维外观特征提升到规范的三维空间。VR3I采用三维几何-语义注意力机制,基于三维空间位置在对应的身体部位之间建立二维补丁与三维体素的交互,有效地将二维语义嵌入三维框架中。此外,由于视角变化和三维重建误差导致这些表示的可靠性在样本间有所不同,我们引入了可靠性感知融合,估计样本特定的可靠性并自适应地聚合多源表示。在三个基准数据集(CARGO、AG-ReID.v1和AG-ReID.v2)上的广泛实验表明,VR3D优于近期方法,例如在CARGO上实现了5.63%的Rank-1提升。我们的代码将会发布。

🔬 方法详解

问题定义:本文旨在解决空中与地面行人重识别中的视角变化问题。现有方法主要在二维图像空间中学习特征,导致在视角变化时性能下降,无法有效应对遮挡和几何变形。

核心思路:VR3D框架的核心思路是将图像映射到统一的三维坐标空间,以实现视角独立的特征交互。通过利用三维先验信息,提升二维特征到三维空间,从而增强特征的鲁棒性。

技术框架:VR3D框架包括多个主要模块:视角稳健的三维表示交互(VR3I)和可靠性感知融合。VR3I通过三维几何-语义注意力机制,建立二维补丁与三维体素之间的交互;而可靠性感知融合则根据样本特定的可靠性自适应地聚合多源表示。

关键创新:本文的关键创新在于引入了视角稳健的三维表示交互机制,利用三维先验信息提升二维特征,并通过可靠性感知融合来增强表示的可靠性。这与现有方法的二维特征学习方式形成了本质区别。

关键设计:在设计中,采用了三维几何-语义注意力机制来建立特征交互,确保不同视角下的特征能够有效对齐。同时,可靠性感知融合模块通过估计每个样本的可靠性,动态调整特征聚合策略,以提高最终的重识别性能。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在CARGO数据集上,VR3D框架实现了5.63%的Rank-1提升,显著优于近期的重识别方法。这一实验结果表明,VR3D在处理视角变化和遮挡问题上具有明显优势,展示了其在实际应用中的潜力。

🎯 应用场景

该研究在监控、公共安全和智能交通等领域具有广泛的应用潜力。通过提高行人重识别的准确性,VR3D框架能够有效支持跨视角的身份识别,提升安全监控系统的效率和可靠性。未来,该技术还可能扩展到无人驾驶、智能城市等更广泛的场景中。

📄 摘要(原文)

Aerial-ground person re-identification is a challenging task due to cross-platform viewpoint variations, which cause severe occlusion and geometric deformation. Existing methods attempt to learn view-invariant representations exclusively within the 2D image space, where drastic viewpoint variations cause the learned features to remain coupled with viewpoint bias. To address this, we propose VR3D, a View-Robust 3D Representation Learning framework that maps images into a unified 3D coordinate space to achieve view-independent feature interaction. Specifically, we introduce View-Robust 3D Representation Interaction, which leverages 3D priors extracted from single 2D observations to lift 2D appearance features into a canonical 3D space. VR3I employs 3D Geometry-Semantic Attention to establish interactions between 2D patches and 3D voxels from corresponding body parts based on their 3D spatial locations, effectively grounding 2D semantics within a 3D framework. In addition, as the reliability of these representations varies across samples due to viewpoint changes and 3D reconstruction errors, we introduce Reliability-Aware Fusion, which estimates sample-specific reliability and adaptively aggregates the multi-source representations. Extensive experiments on three benchmark datasets (CARGO, AG-ReID.v1, and AG-ReID.v2) demonstrate that VR3D outperforms recent methods. For example, it achieves a 5.63% improvement in Rank-1 on CARGO. Our code will be released.