Do Satellites See Commuters? A Critical Benchmark of Vision Foundation Models
作者: Ashiq Shukoor Iqbal, Wilson Wongso, Flora D. Salim
分类: cs.CV
发布日期: 2026-09-01
备注: Accepted to SIGSPATIAL 2026
💡 一句话要点
比较四种卫星视觉编码器以优化通勤OD生成
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 卫星视觉 通勤OD生成 图扩散模型 编码器比较 地理基础模型 自监督学习 语言监督
📋 核心要点
- 现有的通勤OD生成方法依赖于人口普查数据,缺乏系统比较不同编码器的研究,导致性能不均。
- 本文提出在WeDAN图扩散框架下,系统比较四种卫星视觉编码器的性能,以优化通勤OD生成。
- 实验结果显示,语言监督特征表现最佳,地理基础编码器在零样本转移中更可靠,且预训练语料库规模不足以保证性能。
📝 摘要(中文)
卫星基础模型为通勤起点-终点(OD)生成提供了全球可用的替代人口普查数据的方案,但尚无研究在单一下游管道中系统比较编码器范式。本文在相同的WeDAN图扩散框架下,比较了四种卫星视觉编码器:语言监督(RemoteCLIP)、自监督(DINOv3)和地理基础(SatCLIP、AlphaEarth),涵盖1925个美国县、325个英国区和14个全球城市。研究发现,语言监督特征在分布内表现最佳,而地理基础编码器在零样本转移中更可靠。预训练语料库规模不足以保证性能,且没有编码器能有效转移到全球城市,确认跨洲OD生成仍是一个未解决的问题。
🔬 方法详解
问题定义:本文旨在解决卫星基础模型在通勤OD生成中的有效性问题,现有方法未能系统比较不同编码器的性能,导致结果不一致。
核心思路:通过在相同的WeDAN图扩散框架下比较四种不同的卫星视觉编码器,评估其在不同地区的通勤OD生成能力,以找出最佳方案。
技术框架:整体架构包括数据预处理、特征提取、图扩散模型训练和性能评估四个主要模块,确保各编码器在相同条件下进行比较。
关键创新:本文的创新在于系统性地比较了语言监督、自监督和地理基础编码器的性能,揭示了各自的优缺点,尤其是在零样本转移能力上的差异。
关键设计:采用了不同的损失函数和参数设置,特别是对地理基础编码器的设计进行了优化,以提高其在不同地区的适应性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,语言监督特征(RemoteCLIP)在分布内性能达到CPC 0.602,而地理基础编码器(AlphaEarth)在英国地区的表现提升了33%。然而,所有编码器在全球城市的转移性能均较差,最高CPC仅为0.122,显示跨洲OD生成仍需进一步研究。
🎯 应用场景
该研究的潜在应用领域包括城市规划、交通管理和社会经济研究。通过优化通勤OD生成,相关部门可以更好地理解交通流动和人口分布,从而制定更有效的政策和规划。未来,该方法可能会扩展到其他领域,如环境监测和资源分配。
📄 摘要(原文)
Satellite foundation models offer a globally available alternative to census data for commuting origin-destination (OD) generation, yet no study has systematically compared encoder paradigms within a single downstream pipeline. We ablate four satellite vision encoders: language-supervised (RemoteCLIP), self-supervised (DINOv3), and geographically grounded (SatCLIP, AlphaEarth) within an identical WeDAN graph diffusion framework across 1,925 US counties, 325 UK districts, and 14 global cities under five random seeds. Three main findings emerge. First, language-supervised features achieve the strongest in-distribution performance (RemoteCLIP CPC 0.602), while geographically grounded encoders transfer more reliably zero-shot: AlphaEarth improves CPC by 33% over RemoteCLIP on UK districts. Second, pretraining corpus scale alone is insufficient: DINOv3, trained on a substantially larger satellite corpus, underperforms RemoteCLIP by 0.091 CPC in-distribution and collapses to CPC 0.022 globally. Third, no encoder transfers usefully to global cities (best CPC 0.122 for RemoteCLIP, 0.022 for DINOv3), confirming cross-continental OD generation remains an open problem. We additionally clarify the semantics of the census noise parameter $η$, whose ordering reverses under cross-continental evaluation, a distinction critical to correctly interpreting prior results. Training scripts and evaluation logs will be released.