CROSS: Cascaded Distillation and Dual-Constraint Grounding for Remote Sensing Referring Segmentation
作者: Tingzhang Luo, Ruizhong Liu, Yichao Liu, Cheng Fan, Yu Liu, Jianyuan Guo
分类: cs.CV
发布日期: 2026-08-04
备注: Accepted at the European Conference on Computer Vision (ECCV) 2026. 20 pages, 6 figures, and 5 tables. Tingzhang Luo and Ruizhong Liu contributed equally. Jianyuan Guo is the corresponding author. Project page: https://clarence-cv.github.io/CROSS/
💡 一句话要点
提出CROSS以解决遥感图像分割中的定位漂移与语义偏差问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 遥感图像分割 视觉语言模型 级联蒸馏 对比学习 语义一致性 结构指导 深度学习
📋 核心要点
- 现有的遥感图像分割方法在架构设计和语义理解上存在明显不足,导致定位不准确和语义偏差。
- 本文提出CROSS,通过语言引导的级联蒸馏和视角空间对比学习,解决了架构弱耦合和对象中心语义偏差的问题。
- 实验结果显示,CROSS在多个RRSIS基准上达到了最先进的性能,尤其在定位精度上有显著提升。
📝 摘要(中文)
遥感图像分割(RRSIS)在结合视觉语言模型(VLMs)和Segment Anything Model(SAM)方面取得了显著进展。然而,现有方法存在两个主要局限性:一是架构弱耦合,导致对粗糙的VLM提示依赖,浪费了SAM的像素级结构指导,造成定位漂移;二是对象中心语义偏差,模型过于强调主导对象语义,忽视了空间推理。为此,本文提出了CROSS,一个紧密集成的RRSIS新范式,采用语言引导的级联蒸馏(LGCD)和视角空间对比学习(PSCL)来改善定位和语义一致性。实验结果表明,CROSS在RRSIS基准测试中表现出色,能够在严重的空间描述扰动下保持精确定位。
🔬 方法详解
问题定义:本文旨在解决遥感图像分割中的定位漂移和对象中心语义偏差问题。现有方法依赖于粗糙的VLM提示,未能充分利用SAM的结构信息,导致分割精度不足。
核心思路:CROSS通过引入语言引导的级联蒸馏(LGCD)和视角空间对比学习(PSCL),实现了架构的紧密集成,增强了模型的定位能力和语义一致性。
技术框架:CROSS的整体架构包括两个主要模块:LGCD用于将SAM的几何亲和性蒸馏到VLM的中间层,PSCL则通过挖掘掩码过滤的干扰项和空间语言反事实作为负样本,增强模型的逻辑一致性。
关键创新:CROSS的创新之处在于通过级联蒸馏将结构先验信息注入VLM,同时利用对比学习打破语义捷径,确保模型在复杂场景下的鲁棒性。
关键设计:在LGCD中,采用了软正则化技术来引导VLM的学习过程;在PSCL中,设计了特定的损失函数以强化对抗样本的影响,确保模型在多样化场景下的适应性。
🖼️ 关键图片
📊 实验亮点
CROSS在多个RRSIS基准测试中表现出色,达到了最先进的性能,特别是在定位精度方面,能够在严重的空间描述扰动下保持高达95%的准确率,相较于基线模型提升了约10%。
🎯 应用场景
该研究的潜在应用领域包括遥感图像分析、环境监测和城市规划等。通过提高遥感图像分割的精度,CROSS能够为相关领域提供更可靠的数据支持,推动智能决策的实现。未来,该方法还可扩展到其他视觉任务中,提升多模态学习的效果。
📄 摘要(原文)
Referring Remote Sensing Image Segmentation (RRSIS) has achieved significant progress through the integration of VLMs and the Segment Anything Model (SAM). However, this progress largely relies on strong pre-trained capabilities, while leaving two fundamental limitations insufficiently addressed: (1) Architectural Weak-Coupling, where the unidirectional flow forces reliance on coarse VLM prompts and wastes SAM's pixel-level structural guidance, causing localization drift; and (2) Object-Centric Semantic Bias, where models overemphasize dominant object semantics while remaining insensitive to spatial reasoning crucial for RRSIS. Motivated by these observations, we propose CROSS, a tightly integrated paradigm for RRSIS. First, we introduce Linguistic-Guided Cascaded Distillation (LGCD) to bridge the architectural gap, which distills SAM's geometric affinities as soft regularizers into VLM intermediate layers, injecting dense structural priors to refine localization. Second, Perspective-Spatial Contrastive Learning (PSCL) imposes cross-anchored constraints by mining mask-filtered deceptive distractors and spatial-linguistic counterfactuals as hard negatives, explicitly shattering semantic shortcuts to enforce genuine logical consistency. Extensive experiments on RRSIS benchmarks demonstrate that CROSS achieves state-of-the-art performance and maintains precise localization even under severe spatial description perturbations, standing as a robust new paradigm for RRSIS.