Learning from Multimodal Pseudo-Labels for Robust Open-Vocabulary Instance and Panoptic Segmentation
作者: Duy Tran Thanh, Yeejin Lee, Byeongkeun Kang
分类: cs.CV, cs.AI, cs.MM
发布日期: 2026-08-12
备注: 14 pages
期刊: Neurocomputing, 2026
💡 一句话要点
提出多模态伪标签学习框架以解决开放词汇实例和全景分割问题
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 开放词汇分割 多模态学习 伪标签生成 视觉-语言对齐 深度学习
📋 核心要点
- 现有方法在开放词汇实例分割和开放集全景分割中面临噪声伪掩码和视觉-文本对齐不足等挑战。
- 提出的多模态框架利用预训练视觉-语言模型生成伪标签,并通过多种损失函数增强对齐效果。
- 在COCO数据集上的实验结果显示,该方法在OVIS和OSPS基准上均显著优于现有技术,提升幅度明显。
📝 摘要(中文)
本研究针对开放词汇实例分割(OVIS)和开放集全景分割(OSPS)中的挑战,旨在识别预定义和未见的物体类别,而无需大量人工标注。现有方法常常受到噪声伪掩码、有限的视觉-文本对齐以及处理同义词或超出词汇表(OOV)单词的困难等问题的困扰。为了解决这些挑战,我们提出了一种多模态框架,利用预训练的视觉-语言模型进行自动伪标签生成、CLIP引导的同义词过滤和基于GPT的标题重构。通过目标词汇辅助的伪标签生成设置,该框架首先构建伪分割掩码、描述性标题和语义对齐的同义词集,提供无需人工标注的多模态监督。我们通过三种互补的训练目标增强视觉-文本对齐:扩展的对齐损失、语义一致性损失和生成标题重构损失。大量实验表明,该方法在COCO数据集上持续超越现有最先进的方法,在OVIS和OSPS基准上取得显著提升。
🔬 方法详解
问题定义:本论文旨在解决开放词汇实例分割(OVIS)和开放集全景分割(OSPS)中的伪标签噪声、视觉-文本对齐不足及处理OOV词汇的困难等问题。现有方法在这些方面表现不佳,限制了其应用。
核心思路:论文提出的多模态框架通过结合视觉和语言信息,利用预训练模型自动生成伪标签,并通过引导和重构过程提升标签质量和对齐效果。
技术框架:整体架构包括三个主要模块:伪分割掩码生成、同义词过滤和标题重构。首先使用Grounded SAM生成伪掩码,然后通过CLIP进行同义词过滤,最后利用LLaVA进行标题重构,形成完整的伪标签生成流程。
关键创新:最重要的创新在于引入了多模态监督机制,通过视觉-文本对齐损失、语义一致性损失和生成标题重构损失,显著提升了伪标签的质量和模型的性能。
关键设计:在损失函数设计上,扩展的对齐损失考虑了视觉上对齐的同义词,语义一致性损失确保了标签的一致性,生成标题重构损失则增强了模型的生成能力。
🖼️ 关键图片
📊 实验亮点
在COCO数据集上,提出的方法在开放词汇实例分割和开放集全景分割任务中均显著优于现有最先进的方法,具体表现为在OVIS和OSPS基准上分别提升了XX%和YY%的性能,验证了方法的有效性。
🎯 应用场景
该研究的潜在应用领域包括自动驾驶、机器人视觉和智能监控等场景,能够在缺乏大量标注数据的情况下,提升模型对新物体类别的识别能力,具有重要的实际价值和未来影响。
📄 摘要(原文)
This work addresses the challenge of open-vocabulary instance segmentation (OVIS) and open-set panoptic segmentation (OSPS), which aim to recognize both predefined and unseen object categories without exhaustive human annotations. Existing methods often suffer from noisy pseudo-masks, limited visual-textual grounding, and difficulty handling synonyms or out-of-vocabulary (OOV) words. To overcome these challenges, we propose a multimodal framework that leverages pre-trained vision-language models for automatic pseudo-label generation, CLIP-guided synonym filtering, and GPT-based caption reconstruction. In our target-vocabulary-assisted pseudo-labeling setting, the framework first constructs pseudo segmentation masks, descriptive captions, and semantically aligned synonym sets using Grounded SAM, LLaVA, and CLIP, providing multimodal supervision without manual annotation. We then enhance visual-textual alignment through three complementary training objectives: an extended grounding loss that incorporates visually grounded synonyms, a semantic consistency loss, and a generative caption reconstruction loss. Extensive experiments on the COCO dataset demonstrate that the proposed method consistently outperforms previous state-of-the-art approaches under this protocol, achieving substantial improvements on both OVIS and OSPS benchmarks.