GeoDistill-Refine: Silhouette-First Geometry Distillation for Annotation-Free Spacecraft Segmentation
作者: Yonglong Zhang, Zongwu Xie, Yang Liu
分类: cs.CV, cs.AI
发布日期: 2026-08-07
💡 一句话要点
提出GeoDistill-Refine以解决航天器图像分割中的几何错误问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 航天器分割 几何蒸馏 图像分割 深度学习 无监督学习 伪掩膜 TinyUNet
📋 核心要点
- 现有的基础分割模型在航天器图像分割中存在几何错误,且其预测结果受文本提示的影响较大,导致蒸馏效果不稳定。
- 本文提出的GeoDistill-Refine框架通过两阶段学习,首先提取前景轮廓,然后利用多种几何目标进行精炼,从而提高分割精度。
- 实验结果表明,GeoDistill-Refine在多个数据集上显著提升了分割性能,尤其在Image IoU和Boundary F1指标上表现突出。
📝 摘要(中文)
基础分割模型可以在没有手动训练掩膜的情况下为航天器图像提供监督,但其预测结果受文本提示影响且可能包含几何错误,这些错误在蒸馏过程中被放大。本文提出了GeoDistill-Refine,一个两阶段框架,将离线SAM 3伪掩膜转移到紧凑的分割网络中。通过无权重的50%投票融合六个固定提示,以稳定教师输出。学生网络首先学习前景轮廓,然后通过从伪掩膜派生的符号距离场、骨架和面积目标进行精炼。样本级门控通过提示一致性、有效提示比例和伪掩膜区域合理性来减少不可靠伪几何的影响。在SpaceSense-Bench HJM锁箱集上,GeoDistill-Refine在Image IoU和Boundary F1上分别提高了0.0456和0.1380,相较于普通伪标签学生。外部评估显示在SPEED+ Lightbox和Sunlamp领域以及TANGO上具有竞争力的区域重叠,同时在边界质量或前景精度上有所提升。
🔬 方法详解
问题定义:本文旨在解决航天器图像分割中由于基础分割模型预测不稳定而导致的几何错误问题。现有方法在没有手动训练掩膜的情况下,依赖文本提示进行分割,容易受到提示变化的影响,导致结果不一致。
核心思路:GeoDistill-Refine框架采用两阶段的学习策略,首先通过伪掩膜学习前景轮廓,然后利用符号距离场、骨架和面积目标对分割结果进行精炼,从而提高分割的准确性和稳定性。
技术框架:该框架分为两个主要阶段:第一阶段是教师网络生成伪掩膜,第二阶段是学生网络学习和精炼。教师网络通过六个固定提示的无权重投票来稳定输出,而学生网络则通过样本级门控机制来减少不可靠伪几何的影响。
关键创新:最重要的创新在于引入了样本级门控机制,该机制通过计算提示一致性、有效提示比例和伪掩膜区域合理性来过滤不可靠的几何信息,从而显著提高了分割质量。
关键设计:TinyUNet作为学生网络,包含0.263M参数,处理每张图像约需1.1毫秒。伪掩膜的构建和辅助几何分支仅在训练阶段使用,确保了模型在推理时的高效性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,GeoDistill-Refine在SpaceSense-Bench HJM锁箱集上,Image IoU和Boundary F1分别提高了0.0456和0.1380,相较于普通伪标签学生,表现出显著的性能提升。此外,在SPEED+ Lightbox和Sunlamp领域的外部评估中,模型在区域重叠和边界质量上均表现出竞争力。
🎯 应用场景
该研究的潜在应用领域包括航天器图像分析、自动化监测和遥感技术等。通过提高航天器图像的分割精度,GeoDistill-Refine可以为航天任务提供更可靠的数据支持,降低人工标注的需求,提升工作效率。未来,该方法有望推广到其他领域的图像分割任务中,具有广泛的实际价值。
📄 摘要(原文)
Foundation segmentation models can provide supervision for spacecraft imagery without manual training masks, but their predictions vary with textual prompts and may contain geometric errors that are amplified during distillation. This paper presents GeoDistill-Refine, a two-stage framework that transfers offline SAM 3 pseudo-masks to a compact segmentation network. Six fixed prompts are fused by an unweighted 50% vote to stabilize the teacher output. The student first learns the foreground silhouette and is then refined with signed-distance-field, skeleton, and area objectives derived from the pseudo-mask. A sample-level gate, computed from prompt agreement, the valid-prompt ratio, and pseudo-mask area plausibility, reduces the influence of unreliable pseudo-geometry. On the SpaceSense-Bench HJM lockbox set, GeoDistill-Refine improves Image IoU and Boundary F1 by 0.0456 and 0.1380, respectively, over a plain pseudo-label student. External evaluations on the SPEED+ Lightbox and Sunlamp domains and on TANGO show competitive regional overlap together with gains in boundary quality or foreground precision. The deployed TinyUNet contains 0.263 M parameters and requires approximately 1.1 ms per image on an RTX 4090; SAM 3 pseudo-mask construction and the auxiliary geometry branches are used only during training.