Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding
作者: Junyi Hu, Tian Bai, Fengyi Wu, Yian Huang, Wei Wen, Zaoli Li, Junli Lin, Xingchen Li, Zhenming Peng, Yi Zhang
分类: cs.CV
发布日期: 2026-08-13
备注: 21 pages, 10 figures, 6 tables
💡 一句话要点
提出整体数据-模型协同设计框架以解决视觉定位中的表示退化问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱三:空间感知与语义 (Perception & Semantics) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 指称表达理解 视觉-语言对齐 调制注意力 数据-模型协同设计 多样性保持
📋 核心要点
- 现有的指称表达理解方法通常依赖于特定数据集的微调,导致模型在不同数据集间的泛化能力不足。
- 本文提出了一种整体数据-模型协同设计框架,通过调制注意力对比头和文本条件辅助流来增强表示的多样性。
- 实验结果显示,该框架在标准REC基准上表现优异,并在不同数据集间实现了强泛化能力,无需针对特定基准进行适配。
📝 摘要(中文)
指称表达理解(REC)通常在特定数据集上进行微调,导致模型在跨数据集泛化能力有限。本文从统一开放词汇定位的角度重新审视REC,识别出表示退化是扩展单一通用模型的关键障碍。为保持表示多样性,我们提出了一个整体数据-模型协同设计框架。在架构上,引入了调制注意力对比头(mACH),实现高效的标记级视觉-语言对齐,并通过文本条件的JEPA辅助流提供互补梯度支持,以保持对齐活跃的表示而不增加推理开销。在数据方面,我们引入了Objects365-Caption,为Objects365丰富上下文感知的指称表达,以实现大规模语言监督。实验结果表明,我们的单检查点框架在标准REC基准上表现出色,并在异构定位数据集上展现出强大的泛化能力。
🔬 方法详解
问题定义:本文旨在解决指称表达理解(REC)中的表示退化问题,现有方法在跨数据集泛化能力上存在显著不足,限制了单一通用模型的扩展性。
核心思路:我们提出通过整体数据-模型协同设计来保持表示的多样性,利用调制注意力对比头(mACH)和文本条件的JEPA辅助流来增强视觉-语言对齐的效率和效果。
技术框架:整体架构包括两个主要模块:调制注意力对比头用于高效的标记级对齐,JEPA辅助流提供互补梯度支持,确保对齐活跃的表示得到保持。数据方面引入了Objects365-Caption,丰富了上下文感知的指称表达。
关键创新:最重要的创新在于提出了调制注意力对比头(mACH),它通过高效的视觉-语言对齐机制,显著提升了表示的多样性和模型的泛化能力。
关键设计:在设计中,mACH的参数设置经过精心调整,以优化对齐效果;JEPA辅助流的损失函数设计确保了互补梯度的有效性,避免了推理开销的增加。
🖼️ 关键图片
📊 实验亮点
实验结果表明,提出的框架在标准REC基准上达到了竞争力的性能,且在不同的异构定位数据集上展现出强大的泛化能力,显著提高了表示的多样性,具体性能数据未提供。
🎯 应用场景
该研究的潜在应用领域包括智能助手、自动图像标注和人机交互等,能够提升机器对自然语言指令的理解能力,进而改善用户体验。未来,该方法有望在多模态学习和跨领域应用中发挥更大的作用。
📄 摘要(原文)
Referring Expression Comprehension (REC) is commonly studied under dataset-specific fine-tuning, resulting in specialist models with limited cross-dataset generalization. In this work, we revisit REC from the perspective of unified open-vocabulary grounding and identify representation degeneration as a key obstacle to scaling a single generalist model. To preserve representation diversity, we propose a holistic data-model co-design framework. Architecturally, we introduce the Modulated Attention-Contrastive Head (mACH) for efficient token-level vision-language alignment and a text-conditioned JEPA auxiliary stream that provides complementary gradient support to preserve alignment-active representations without inference overhead. On the data side, we introduce Objects365-Caption, enriching Objects365 with context-aware referring expressions for large-scale language supervision. We further provide a theoretical analysis showing that complementary gradient subspaces preserve alignment capacity and thereby scale representation diversity. Extensive experiments demonstrate that our single-checkpoint framework achieves highly competitive performance on standard REC benchmarks while exhibiting strong generalization across heterogeneous grounding datasets without benchmark-specific adaptation.