UniGeo: A Multi-modal Large Language Model for Text-Guided Cross-View Geo-Localization
作者: Jiahao Wen, Hang Yu, Zhedong Zheng
分类: cs.CV
发布日期: 2026-08-27
💡 一句话要点
提出UniGeo以解决文本引导的无人机地理定位问题
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 无人机定位 多模态学习 地理语义理解 跨视图生成 文本引导
📋 核心要点
- 现有文本引导的无人机地理定位方法在处理不完整查询和相似候选图像时存在不足,导致定位精度不高。
- UniGeo通过建立地理语义学习和跨视图生成的框架,提供了一种新的多模态大语言模型解决方案,增强了文本与图像的匹配能力。
- 在GeoText-1652数据集上,UniGeo在R@10和mAP指标上分别提升了13.59和2.83个百分点,验证了其在细粒度定位中的有效性。
📝 摘要(中文)
文本引导的无人机地理定位旨在根据自然语言描述在大规模图像库中识别目标区域。现有方法主要将此任务视为开放式文本查询与候选图像之间的直接匹配。然而,不完整的查询和高度相似的候选图像使得全局跨模态匹配在可靠的细粒度定位中显得不足。为此,本文提出了UniGeo,一个统一的多模态大语言模型,支持地理语义理解、跨视图语义生成和候选级验证。通过地理语义学习,UniGeo在局部场景元素、空间关系和语言描述之间建立稳定的对应关系,并通过跨视图生成建模无人机与卫星视图之间的语义映射。实验结果表明,UniGeo在多个检索基准上均表现出一致的提升。
🔬 方法详解
问题定义:本文旨在解决文本引导的无人机地理定位问题,现有方法在处理不完整查询和高度相似候选图像时,常常无法实现可靠的细粒度定位。
核心思路:UniGeo通过一个统一的多模态大语言模型,结合地理语义理解和跨视图生成,增强了文本与图像之间的匹配能力,特别是在复杂场景下的定位精度。
技术框架:UniGeo的整体架构包括三个主要模块:地理语义学习模块、跨视图生成模块和候选验证模块。首先,通过地理语义学习建立局部场景元素与语言描述的对应关系;其次,利用跨视图生成实现无人机视图与卫星视图之间的语义映射;最后,候选验证模块进行细粒度的候选图像筛选。
关键创新:UniGeo的主要创新在于其统一的多模态框架,能够同时处理地理语义理解和跨视图生成,显著提高了文本引导的定位精度,与传统方法相比具有本质的优势。
关键设计:在模型设计中,采用了多阶段训练策略,逐步学习地理语义理解、跨视图生成和候选验证,优化了模型的适应性。此外,验证模块采用了插件式设计,便于与不同的检索基线结合。
🖼️ 关键图片
📊 实验亮点
在GeoText-1652数据集上,UniGeo在R@10和mAP指标上分别提升了13.59和2.83个百分点,显示出其在细粒度文本引导无人机地理定位中的显著效果,超越了多个基线模型。
🎯 应用场景
该研究的潜在应用领域包括无人机导航、地理信息系统(GIS)和智能城市建设等。通过提高文本引导的地理定位精度,UniGeo能够在复杂环境中实现更为精准的目标识别,具有重要的实际价值和未来影响。
📄 摘要(原文)
Text-guided drone geo-localization aims to identify a target region in a large-scale image gallery from a natural-language description. Existing methods mainly formulate this task as direct matching between an open-ended text query and candidate images. However, incomplete queries and highly similar candidates often make global cross-modal matching insufficient for reliable fine-grained localization. We propose UniGeo, a unified multimodal large language model (MLLM) for text-guided drone geo-localization. Built on a shared vision-language framework, UniGeo jointly supports geo-semantic understanding, cross-view semantic generation, and candidate-level verification. Specifically, it establishes stable correspondences among local scene elements, spatial relations, and language descriptions through geo-semantic learning, and further models semantic mappings between drone and satellite views through cross-view generation. Based on these capabilities, a plug-and-play verification module performs fine-grained discrimination among highly confusable candidates. We further introduce a multi-stage training strategy that progressively learns geo-semantic understanding, cross-view generation, and candidate verification, improving adaptation to text-guided geo-localization. Experiments demonstrate consistent improvements across multiple retrieval backbones. On GeoText-1652, UniGeo improves R@10 and mAP by 13.59 and 2.83 percentage points, respectively, validating its effectiveness for fine-grained text-guided drone geo-localization.