Zero-OVCD: Bridging Training-Free Foundation Models and Pseudo-Label Learning for Open-Vocabulary Change Detection
作者: Daifeng Peng, Yuanke Peng, Haiyan Guan
分类: cs.CV
发布日期: 2026-08-12
备注: 10 figures, 9 tables
🔗 代码/项目: GITHUB
💡 一句话要点
提出Zero-OVCD以解决开放词汇变化检测中的标注依赖问题
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 开放词汇变化检测 伪标签学习 遥感图像 无训练模型 变化检测 多尺度融合 语义相似性
📋 核心要点
- 现有的开放词汇变化检测方法在候选掩膜的准确性和语义分配上存在不足,导致推理错误累积。
- Zero-OVCD通过两阶段框架生成高质量的变化伪标签,避免了对目标领域像素级标注的依赖。
- 在LEVIR-CD、WHU-CD和S2Looking等数据集上,F1分数从第一阶段的86.25%提升至第二阶段的88.65%。
📝 摘要(中文)
开放词汇变化检测(OVCD)能够识别用户指定的土地覆盖变化,但现有的无训练管道容易受到不准确候选掩膜、模糊语义分配和累积推理错误的影响。为了解决这些问题,本文提出了Zero-OVCD,一个无需目标领域像素级标注的两阶段框架。在第一阶段,通过互补候选掩膜精炼、多尺度语义相似性融合和响应引导的掩膜校正与补全生成高质量的变化伪标签。这些组件共同抑制噪声候选,增强掩膜级语义区分,并恢复遗漏的变化区域。在第二阶段,使用生成的伪标签训练变化检测器,同时引入检查点投票和高一致性样本选择以减轻残余伪标签噪声。实验结果表明,该方法在多个数据集上显著提高了变化检测的性能。
🔬 方法详解
问题定义:本文旨在解决开放词汇变化检测中对目标领域像素级标注的依赖问题。现有方法在候选掩膜的准确性和语义分配上存在不足,导致推理过程中出现累积错误。
核心思路:Zero-OVCD的核心思路是通过两阶段框架生成高质量的变化伪标签,第一阶段专注于候选掩膜的精炼和语义增强,第二阶段则利用生成的伪标签进行变化检测器的训练。
技术框架:Zero-OVCD的整体架构分为两个主要阶段。第一阶段包括候选掩膜精炼、多尺度语义相似性融合和响应引导的掩膜校正与补全;第二阶段则是使用生成的伪标签进行训练,并引入检查点投票和高一致性样本选择。
关键创新:本研究的关键创新在于将无训练基础模型推理与噪声感知伪标签学习相结合,提供了一种有效的解决方案,显著提升了开放词汇变化检测的性能。
关键设计:在第一阶段,采用了边际可靠性过滤和多尺度语义相似性融合等技术,确保生成的伪标签质量高;在第二阶段,通过检查点投票和高一致性样本选择来减轻伪标签噪声的影响。具体的损失函数和网络结构细节在论文中进行了详细描述。
🖼️ 关键图片
📊 实验亮点
在LEVIR-CD、WHU-CD和S2Looking数据集上,第一阶段的F1分数分别为86.25%、85.82%和50.48%,而第二阶段进一步提升至88.65%、88.85%和57.96%。在SECOND数据集上,宏平均F1从47.91%提升至50.92%,显示出显著的性能提升。
🎯 应用场景
该研究具有广泛的应用潜力,尤其在遥感图像分析、环境监测和城市规划等领域。通过减少对标注数据的依赖,Zero-OVCD能够加速变化检测的部署,提高对土地覆盖变化的响应速度和准确性,具有重要的实际价值和未来影响。
📄 摘要(原文)
Open-vocabulary change detection (OVCD) enables the identification of user-specified land-cover changes in bitemporal remote sensing images, but existing training-free pipelines remain vulnerable to inaccurate candidate masks, ambiguous semantic assignments, and accumulated inference errors. To address these issues, we propose Zero-OVCD, a two-stage framework that requires no pixel-level annotations from the target domain. In the first stage, high-quality change pseudo-labels are generated through complementary candidate-mask refinement, multiscale semantic similarity fusion with margin-based reliability filtering, and response-guided mask correction and completion. These components jointly suppress noisy candidates, enhance mask-level semantic discrimination, and recover missed change regions. In the second stage, a change detector is trained using the generated pseudo-labels, while checkpoint voting and high-agreement sample selection are introduced to mitigate residual pseudo-label noise. On LEVIR-CD, WHU-CD, and S2Looking, Stage I achieves F1 scores of 86.25%, 85.82%, and 50.48%, while Stage II further improves them to 88.65%, 88.85%, and 57.96%, respectively. On SECOND, the macro-average F1 across six category-wise one-vs-rest tasks increases from 47.91% to 50.92%. These results demonstrate that bridging training-free foundation-model inference with noise-aware pseudo-label learning provides an effective solution for open-vocabulary change detection without target-domain pixel-level annotations. Code will be available at https://github.com/1321663019/Zero-OVCD.