CogVis: Must Open-Vocabulary Change Detection Perceive the Scene Anew for Every Query?
作者: Zijie Wang, Chen Zhong, Wei He
分类: cs.AI, cs.CV
发布日期: 2026-08-06
备注: 19 pages, 11 figures, including 3 supplementary figures. Code: https://github.com/KotlinWang/CogVis
💡 一句话要点
提出CogVis以解决开放词汇变化检测中的场景感知问题
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)
关键词: 开放词汇变化检测 认知记忆 场景变化感知 语义校准 自适应过滤 地表监测 智能监测系统
📋 核心要点
- 现有的开放词汇变化检测方法在时间感知、语义区分和区域验证方面存在交织,导致结果不稳定和计算冗余。
- CogVis通过引入认知记忆引导的框架,将变化检测重构为感知-记忆-验证的范式,从而提高了检测的准确性和效率。
- 在七个基准测试上,CogVis在语义变化检测、二元变化定位和建筑损伤评估任务中均表现出最先进的性能,推理吞吐量提升了28.50%。
📝 摘要(中文)
地表监测需要能够识别任意语义类别的变化检测模型。开放词汇变化检测(OVCD)旨在满足这一需求。然而,现有方法常常将时间感知、语义区分和区域验证交织在一起,导致结果不稳定和冗余计算。受人类视觉变化感知的启发,本文提出了CogVis,一个认知记忆引导的框架,将OVCD重新构建为感知-记忆-验证范式。CogVis首先利用场景变化感知器(SCP)从冻结的双时态特征中提取可重用的类别无关变化先验,从而将时间证据与语义类别决策解耦。接着,语义记忆校准器(SMC)通过动态估计图像查询特定的决策阈值来补偿类别相关的得分偏移。最后,自适应区域过滤器(ARF)使用学习到的语义、时间和结构可靠性过滤连接候选。实验表明,CogVis在所有评估数据集上均实现了最先进的性能,并通过共享场景级变化感知,避免了在查询中重复类别无关的时间感知,提高了28.50%的推理吞吐量。
🔬 方法详解
问题定义:本文旨在解决开放词汇变化检测(OVCD)中的时间感知与语义决策交织的问题,现有方法导致结果不稳定和冗余计算。
核心思路:CogVis通过引入认知记忆引导的框架,将变化检测过程分为感知、记忆和验证三个阶段,以提高检测的准确性和效率。
技术框架:CogVis的整体架构包括三个主要模块:场景变化感知器(SCP)、语义记忆校准器(SMC)和自适应区域过滤器(ARF)。SCP提取类别无关的变化先验,SMC动态调整决策阈值,ARF根据学习到的可靠性过滤候选区域。
关键创新:CogVis的核心创新在于将时间证据与语义类别决策解耦,并通过共享场景级变化感知来避免在不同查询中重复计算,从而显著提高推理效率。
关键设计:在设计中,SCP使用冻结的双时态特征提取变化先验,SMC动态估计决策阈值以补偿得分偏移,ARF则基于学习的语义、时间和结构可靠性进行区域过滤。
🖼️ 关键图片
📊 实验亮点
在七个基准测试中,CogVis在语义变化检测、二元变化定位和建筑损伤评估任务上均实现了最先进的性能,推理吞吐量提升了28.50%。与现有方法相比,CogVis在准确性和效率上均有显著提升,展示了其在开放词汇变化检测中的优势。
🎯 应用场景
CogVis的研究成果在地表监测、城市规划、灾后评估等领域具有广泛的应用潜力。通过提高变化检测的准确性和效率,CogVis能够为环境监测、基础设施维护和灾害响应提供更为可靠的支持,推动智能监测系统的发展。
📄 摘要(原文)
Earth-surface monitoring requires change detection models capable of recognizing arbitrary semantic categories. Open-Vocabulary Change Detection (OVCD) addresses this need. However, existing methods often entangle temporal perception, semantic discrimination, and region verification, causing unstable results and redundant computation. Inspired by human visual change perception, we propose CogVis, a cognitive memory-guided framework that reformulates OVCD as a perception-memory-verification paradigm. CogVis first employs a Scene Change Perceptron (SCP) to extract a reusable, category-agnostic change prior from frozen bi-temporal features, thereby decoupling temporal evidence from semantic category decisions. A Semantic Memory Calibrator (SMC) then compensates for category-dependent score shifts by dynamically estimating an image-query-specific decision threshold. Finally, an Adaptive Region Filter (ARF) filters connected candidates using learned semantic, temporal, and structural reliability. Experiments on seven benchmarks spanning semantic change detection, binary change localization, and building-damage assessment show that CogVis achieves state-of-the-art performance across all evaluated datasets. By sharing scene-level change perception, CogVis further avoids repeating category-agnostic temporal perception across queries and improves inference throughput by 28.50%.