Cost-efficient Active Learning for Referring Image Segmentation and Grounding
作者: Junbeom Hong, Seonghoon Yu, Hyung Rok Jung, Sundong Kim, Jeany Son
分类: cs.CV, cs.AI
发布日期: 2026-08-31
备注: Accepted to EMNLP 2026 Findings
💡 一句话要点
提出成本有效的主动学习方法以解决视觉定位中的标注瓶颈问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 主动学习 视觉定位 图像分割 自然语言处理 标注效率
📋 核心要点
- 现有视觉定位方法在标注过程中依赖于自然语言描述,导致标注效率低下,尤其是在视觉相似区域的区分上。
- 本文提出了一种主动学习框架,通过生成区域-文本对和引入指代区域模糊性来优化样本选择,提升标注效率。
- 实验结果显示,本文方法在多个基准测试中表现优异,相较于传统方法,标注速度提升了1.6倍。
📝 摘要(中文)
在视觉定位(VG)中,收集自然语言的指代表达及区域标注(如掩膜或框)是一个主要瓶颈,因为标注者必须编写描述以区分目标区域与视觉上相似的区域。本文在仅有原始图像而无伴随文本的现实场景下,提出了一种主动学习(AL)方法。由于缺乏真实文本,样本选择必须估计哪些图像包含需要区分性指代表达的模糊区域。为此,本文利用基础模型生成辅助的区域-文本对,并引入了一种新的获取函数——指代区域模糊性,来衡量模型的置信度是集中在单一区域还是分散在多个候选区域。该方法优先选择视觉上模糊且竞争激烈的图像,从而提供更有信息量的样本。实验结果表明,本文的AL框架在RIS和REC基准测试中均优于多种AL基线,同时用户研究显示描述标注速度提高了1.6倍。
🔬 方法详解
问题定义:本文旨在解决视觉定位中标注效率低下的问题,现有方法在仅有图像而无文本的情况下难以有效区分视觉相似区域。
核心思路:通过主动学习框架,利用基础模型生成辅助的区域-文本对,并引入指代区域模糊性作为获取函数,以选择信息量更大的样本。
技术框架:整体流程包括图像输入、区域-文本对生成、指代区域模糊性计算和样本选择四个主要模块。首先输入原始图像,然后生成可能的区域-文本对,接着计算模糊性并选择最具信息量的样本进行标注。
关键创新:引入指代区域模糊性作为新的获取函数,能够有效衡量模型对区域的置信度分布,从而优先选择视觉上竞争激烈的图像,这一创新显著提升了样本选择的有效性。
关键设计:在模型设计上,采用了基础模型生成区域-文本对,损失函数设计上注重模糊性度量,确保选择的样本具有较高的信息量和标注价值。具体参数设置和网络结构细节在实验部分进行了详细描述。
🖼️ 关键图片
📊 实验亮点
实验结果表明,本文的主动学习框架在RIS和REC基准测试中均优于多种传统AL基线,标注速度提升达到1.6倍,显示出显著的效率优势和实用价值。
🎯 应用场景
该研究的潜在应用领域包括计算机视觉中的图像分割、目标检测和人机交互等场景。通过提高标注效率,能够加速视觉模型的训练过程,降低人工标注成本,未来可能在自动驾驶、智能监控等领域产生重要影响。
📄 摘要(原文)
Collecting natural-language referring expressions along with region annotations, such as masks or boxes, is a major bottleneck in visual grounding (VG), as annotators must write descriptions that distinguish target regions from visually similar ones. We tackle this by formulating active learning (AL) for VG under the realistic setting where only raw images are available without accompanying text. Since ground-truth text is unavailable, sample selection must estimate which images contain ambiguous regions that would require discriminative referring expressions. To address this, we generate auxiliary region-text pairs using foundation models, and introduce Referred Region Ambiguity, a new acquisition function that measures whether the model's confidence collapses onto a single region or disperses across multiple candidates. It allows our method to prioritize images with strong cross-region competition, which are more informative due to their visual ambiguity. We also design a referring-expression annotation interface that helps annotators quickly focus on writing discriminative language with a few clicks. Experiments on RIS and REC benchmarks show that our AL framework consistently outperforms several AL baselines, while a user study shows up to 1.6X faster description labeling of ours.