A-PAIR: A Benchmark and Identity-Consistent Grounding Framework for Air-Ground Cross-View Referring Person Detection
作者: Zhoupeng Guo, Xinjie Yao, Yunqi Zhu, Zhihe Fan, Siqi Zhao, Jianjun Chen, Yichen Dong, Yan Fan, Pengfei Zhu
分类: cs.CV, cs.MM
发布日期: 2026-08-28
💡 一句话要点
提出A-PAIR框架以解决空地视角下的个体一致性检测问题
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)
关键词: 空地交叉视角 指称人检测 身份一致性 因子化注释 机器学习 计算机视觉 无人机技术
📋 核心要点
- 现有方法未能同时考虑交叉视角下的身份一致性,导致在复杂场景中表现不足。
- 提出A-PAIR基准和FARA框架,以高效生成因子化指称描述和身份一致性监督。
- ICRG框架在强基线基础上显著提升检测性能,配对F1从16.65%提高至22.28%。
📝 摘要(中文)
空地交叉视角的指称人检测是集体具身智能中语言到感知再到控制链的重要组成部分,旨在将语言指令与同一物理目标相结合,以便地面和空中代理能够协调后续行动。现有的指称表达理解和开放词汇基础方法未能共同考虑交叉视角下的身份一致性,导致其在空地交叉视角指称人检测(AGCV-RPD)中表现不足。为了解决这一问题,本文提出了A-PAIR,这是首个全面的AGCV-RPD基准,包含22,137个交叉视角指称样本。我们还提出了因子化注释和指称对齐(FARA)框架,以降低成本高效构建A-PAIR,并提出身份一致性指称基础(ICRG)框架,结合因子化指称基础、候选完整性监督和交叉视角一致性校准,显著提升检测性能。
🔬 方法详解
问题定义:本文旨在解决空地交叉视角指称人检测中的身份一致性问题。现有方法在处理相似行人干扰、弱空中外观线索时,未能有效保持身份一致性,导致检测效果不佳。
核心思路:论文提出A-PAIR基准和FARA框架,通过因子化注释和身份一致性监督,降低注释成本并提高检测精度。ICRG框架结合多种监督机制,确保空地配对选择的一致性。
技术框架:整体架构包括数据集构建、因子化注释生成、身份一致性监督和检测模型训练。主要模块包括FARA用于注释生成,ICRG用于检测和配对选择。
关键创新:A-PAIR基准的提出及FARA框架的设计是本研究的核心创新,前者提供了丰富的交叉视角样本,后者通过半自动化方式降低了注释成本。与现有方法相比,ICRG在身份一致性推理上表现出显著优势。
关键设计:在ICRG中,采用了候选完整性监督和交叉视角一致性校准等技术细节,以确保模型在不同视角下的检测一致性。损失函数设计上,强调了身份一致性的重要性,以提升整体检测性能。
🖼️ 关键图片
📊 实验亮点
实验结果表明,ICRG框架在强基线基础上显著提升了检测性能,配对F1从16.65%提高至22.28%。这些结果验证了AGCV-RPD任务中配对检测和身份一致性推理的重要性。
🎯 应用场景
该研究的潜在应用领域包括无人机监控、智能交通系统和人机协作等场景。通过提高空地交叉视角下的个体检测精度,能够有效支持复杂环境中的自动化决策和行动协调,具有重要的实际价值和未来影响。
📄 摘要(原文)
Air-ground cross-view referring person detection is a necessary component in the language-to-perception-to-control chain of collective embodied intelligence, grounding a language command into the same physical target before ground and aerial agents can coordinate downstream actions. Existing referring expression comprehension and open-vocabulary grounding methods do not jointly account for cross-view identity consistency, making them insufficient for Air-Ground Cross-View Referring Person Detection (AGCV-RPD), which involves similar pedestrian distractors, weak aerial appearance cues, and cross-view identity consistency. To study this problem, we introduce Air-Ground Paired Identity-Aware Referring (A-PAIR), the first comprehensive AGCV-RPD benchmark, containing 22,137 cross-view referring samples. To construct A-PAIR efficiently, we propose Factorized Annotation and Referential Alignment (FARA), a semi-automatic annotation framework that generates factorized referring descriptions and identity-consistency supervision at reduced cost. We propose Identity-Consistent Referring Grounding (ICRG), a framework that combines factorized referential grounding, candidate-completeness supervision, and cross-view consistency calibration for joint air-ground pair selection. ICRG improves ground, aerial, and pair-level detection over strong baselines, increasing pair F1 from 16.65% to 22.28%. These results show that AGCV-RPD requires paired detection and identity-consistent reasoning.