MultiGlobeQA: A Multilingual and Globally Diverse Benchmark for Geospatial Reasoning
作者: Martin Böckling, Elizaveta Nosova, Heiko Paulheim, Andreea Iana
分类: cs.CL, cs.AI, cs.IR
发布日期: 2026-08-04
💡 一句话要点
提出MultiGlobeQA以解决地理空间推理的多语言基准问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 地理空间推理 多语言基准 大型语言模型 知识图谱 空间功能 低收入地区 性能评估
📋 核心要点
- 现有的地理空间推理基准测试多为合成或小规模,且大多是单语种,无法全面评估大型语言模型的能力。
- 本文提出MultiGlobeQA,一个包含46,060个问答对的多语言基准,旨在全面评估LLMs在地理空间推理中的表现。
- 实验结果显示,LLMs在需要网格索引和形状计算的任务上表现不佳,且在低收入地区的表现差距更大。
📝 摘要(中文)
地理空间推理,即计算距离、包含关系及其他空间关系,对于导航和物流至关重要。然而,现有的大型语言模型在几何和拓扑计算方面表现不佳。现有基准测试仅部分定位了这些失败,且多为合成或小规模、单语种,地理覆盖有限。本文提出MultiGlobeQA,这是一个包含46,060个问答对的多语言基准,涵盖14个空间功能类别和15种回答格式,基于三个知识图谱提供执行基础的真实答案。该基准覆盖201个国家和地区,并通过收入和密度分层抽样,提供英语及16种高低资源语言的平行问题。实验表明,LLMs在需要网格索引和形状计算的任务上表现不佳,而拓扑关系和方向的表现相对较好。检索和工具使用带来了显著提升,但即使提供黄金事实,性能仍未超过三分之二,表明计算能力而非知识获取是瓶颈。
🔬 方法详解
问题定义:本文旨在解决现有地理空间推理基准测试的不足,尤其是合成和小规模测试无法全面评估LLMs的能力。现有方法在多语言和地理覆盖方面存在明显缺陷。
核心思路:MultiGlobeQA通过构建一个包含多语言和多样化地理覆盖的问答基准,提供了一个更全面的评估工具,旨在揭示LLMs在地理空间推理中的真实能力。
技术框架:该基准包含46,060个问答对,涵盖14个空间功能类别和15种回答格式,基于三个知识图谱提供执行基础的真实答案。问题通过收入和密度分层抽样覆盖201个国家和地区,并提供英语及16种其他语言的平行问题。
关键创新:MultiGlobeQA的创新在于其多语言和全球多样性,能够全面评估LLMs在不同地理和语言环境下的表现,尤其是低收入地区的表现。
关键设计:在设计中,采用了执行基础的真实答案,确保问题的真实性和有效性。同时,采用了分层抽样方法,以确保样本的代表性和多样性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,LLMs在需要网格索引和形状计算的任务上表现不佳,性能未超过三分之二。尽管检索和工具使用带来了显著提升,但在低收入地区的表现差距更大,黄金事实的提供未能有效缩小这一差距。
🎯 应用场景
该研究的潜在应用领域包括导航系统、物流优化、地理信息系统等。通过提升LLMs在地理空间推理中的表现,可以为智能交通、城市规划和环境监测等领域提供更精准的支持,具有重要的实际价值和未来影响。
📄 摘要(原文)
Geospatial reasoning, i.e., computing distances, containment, and other spatial relations over real-world entities, is central to navigation and logistics, yet large language models (LLMs) struggle with the required geometric and topological computation despite storing considerable geographic knowledge. Existing benchmarks localize these failures only partially: they are synthetic or smallscale, largely monolingual, and offer limited control over geographic coverage. We introduce MultiGlobeQA, a multilingual benchmark of 46,060 question-answer pairs spanning 14 spatial-function families and 15 answer formats, with execution-based ground truth over three knowledge graphs. It covers 201 countries and territories via income- and density-stratified sampling, with parallel questions in English and 16 additional high- and low-resource languages. Across parametric, reasoning, and agentic settings, LLMs collapse on tasks requiring grid indexing and shape computation, while topological relations and directions fare best. Retrieval and tool use yield considerable gains, yet performance plateaus below two thirds even when gold facts are supplied, indicating that computation, not access to knowledge, is the bottleneck. Models also underperform on low-income regions, a gap that gold facts widen rather than close.