Few-Shot Open-Vocabulary Remote Sensing Segmentation via Textual Inversion
作者: Junhyuk Heo, Junghwan Park
分类: cs.CV
发布日期: 2026-07-28
💡 一句话要点
通过文本反转实现少样本开放词汇遥感分割
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)
关键词: 遥感分割 开放词汇 文本反转 少样本学习 视觉-语言模型
📋 核心要点
- 现有的开放词汇分割方法在遥感图像上表现不佳,主要是由于文本查询的有效性不足。
- 论文提出通过文本反转技术,从少量示例中提取更有效的查询地址,改善分割效果。
- 在代表性基准上,受影响类别的平均交并比从3.9提升至39.4,展示了显著的性能提升。
📝 摘要(中文)
开放词汇分割能够根据文本查询标注任意类别,而无需针对每个类别进行训练。然而,在遥感图像上,该方法在某些类别的表现不如其他场景。研究发现,这一差距主要源于文本查询而非分割模型本身。由于现有模型未针对高空图像进行优化,作为查询的类别名称往往无法有效映射到视觉-语言嵌入空间。本文提出通过文本反转技术,从少量示例中恢复更有效的查询地址,显著提升了受影响类别的平均交并比,从3.9提高至39.4,并在八个遥感数据集上超越了注入视觉提示的少样本方法。
🔬 方法详解
问题定义:本文旨在解决开放词汇分割在遥感图像中表现不佳的问题,现有方法的痛点在于文本查询的有效性不足,导致分割效果不理想。
核心思路:通过文本反转技术,从少量示例中提取更有效的查询地址,以改善视觉-语言嵌入空间的映射效果,从而提升分割性能。
技术框架:整体架构包括文本反转模块和冻结模型的推理过程。首先,通过少量示例生成新的文本查询,然后将其输入到冻结的视觉-语言模型中进行推理。
关键创新:最重要的技术创新在于利用文本反转从少量示例中恢复有效的查询地址,这一方法与传统的视觉提示注入方法本质上不同,后者依赖于视觉信息而非文本信息。
关键设计:在参数设置上,保持模型冻结以避免过拟合,同时优化文本查询的生成过程,确保生成的查询能够有效映射到视觉-语言嵌入空间。
🖼️ 关键图片
📊 实验亮点
实验结果显示,受影响类别的平均交并比从3.9提升至39.4,提升幅度显著。在八个遥感数据集上,该方法超越了传统的少样本方法,展示了文本反转技术在提升分割性能方面的有效性。
🎯 应用场景
该研究在遥感图像分析、环境监测和农业监控等领域具有广泛的应用潜力。通过提升开放词汇分割的性能,可以更有效地进行土地利用分类、灾害评估等任务,进而推动遥感技术的实际应用和发展。
📄 摘要(原文)
Open-vocabulary segmentation labels arbitrary categories from a text query without per-class training, yet on remote sensing imagery it underperforms on categories it handles reliably elsewhere. We find that much of this gap traces to the text query rather than to the segmentation model. Because these models are not specialized for overhead imagery, the class name that serves as the query is often a weak address into the vision-language embedding space. We show that a better name repairs part of the gap, while the remaining failures call for an address that the tested natural-language rephrasings do not provide. We recover that address from a few examples through textual inversion on a frozen model, keeping inference text only. On a representative benchmark this raises the mean intersection over union on the affected categories from 3.9 to 39.4, and across eight remote sensing datasets it improves over few-shot methods that instead inject visual prompts at inference.