OPUS: A Simple yet Effective Unified Framework for Open-Vocabulary Detection
作者: Xiaoyan Wei, Zhimin Yao, Ruilin Yang, Wei Zhang, Yong Dai, Yi Zhang, Wei Ge
分类: cs.CV
发布日期: 2026-08-31
💡 一句话要点
提出OPUS框架以简化开放词汇检测任务
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 开放词汇检测 多模态融合 视觉编码 统一框架 实例级对比对齐
📋 核心要点
- 现有的开放词汇检测方法往往依赖复杂的设计,导致系统效率低下和可扩展性差。
- OPUS框架通过简化设计,结合语义丰富的视觉表示和可扩展的基础监督,提供了一种统一的检测解决方案。
- 在多个数据集上,OPUS实现了68.1/69.2/54.7的AP,展示了其在文本和视觉准确性上的平衡提升。
📝 摘要(中文)
近年来,统一的开放词汇检测(OVD)支持多种异构提示,包括文本查询、视觉示例及其组合,但往往依赖于复杂的设计,如重的跨模态融合、分阶段训练和迭代注释流程。本文提出OPUS框架,旨在简化这一过程。OPUS支持文本、交互视觉、通用视觉和混合提示,采用简单的三部分设计,结合了基于DINOv3-ConvNeXt-B的语义丰富视觉编码器和避免提示特定分支的提示感知解码器。通过实例级对比对齐(ICA)进行单阶段训练,OPUS在COCO、LVIS-minival和ODinW35数据集上实现了最先进的视觉性能,显示出简单性与强大的统一提示能力可以兼得。
🔬 方法详解
问题定义:本文旨在解决现有开放词汇检测方法的复杂性问题,这些方法通常依赖于重的跨模态融合和分阶段训练,导致效率低下和可扩展性不足。
核心思路:OPUS框架的核心思想是通过简化设计,利用语义丰富的视觉表示和可扩展的基础监督,来实现统一的开放词汇检测。这样的设计使得不同类型的提示可以在同一框架内有效地进行处理。
技术框架:OPUS的整体架构由三个主要部分组成:一个基于DINOv3-ConvNeXt-B的语义丰富视觉编码器,一个避免提示特定分支的提示感知解码器,以及一个支持异构基础监督的单通道数据引擎。
关键创新:OPUS的主要创新在于其简化的三部分设计和实例级对比对齐(ICA)训练策略,使得统一的提示推理成为可能,而不需要复杂的提示特定分支。
关键设计:在技术细节上,OPUS采用了高效的混合编码方式,确保了视觉编码器的性能,同时通过单阶段训练策略提高了训练效率。
🖼️ 关键图片
📊 实验亮点
在多个数据集上的实验结果显示,OPUS在视觉性能上达到了68.1/69.2/54.7的AP,超越了现有的基线方法。同时,OPUS在文本和视觉准确性上保持了良好的平衡,展示了混合提示的互补性,显著提升了检测效果。
🎯 应用场景
OPUS框架在计算机视觉领域具有广泛的应用潜力,尤其是在需要处理多种提示形式的开放词汇检测任务中。其简化的设计和高效的性能使其适用于实时检测系统、智能监控、自动驾驶等场景,未来可能推动相关技术的进一步发展与应用。
📄 摘要(原文)
Recent unified open-vocabulary detection (OVD) supports heterogeneous prompts, including text queries, visual exemplars, and their combinations, but often rely on increasingly complex designs such as heavy cross-modal fusion, staged training, and iterative annotation pipelines. We revisit whether such complexity is necessary in the era of stronger foundation models. Our finding is that unified OVD can be made substantially simpler with semantic-rich visual representations and scalable grounding supervision. We present OPUS (\textbf{O}pen-vocabulary, \textbf{P}rompt-\textbf{U}nified, \textbf{S}imple), a unified detector supporting text, interactive visual, generic visual, and mixed prompting within one framework. OPUS adopts a simple three-part design. Its model architecture combines a semantic-rich visual encoder, built on a DINOv3-ConvNeXt-B backbone with efficient hybrid encoding, with a prompt-aware decoder that avoids prompt-specific branches for unified prompt reasoning. OPUS is trained with a one-stage text-visual training strategy with Instance-level Contrastive Alignment (ICA), and is supported by a SAM3-based single-pass data engine for heterogeneous grounding supervision. Experiments on COCO, LVIS-minival, and ODinW35 show that OPUS achieves state-of-the-art Visual-I performance, reaching 68.1/69.2/54.7 AP, while maintaining balanced Text and Visual-G accuracy. OPUS also turns mixed prompting from interference into complementarity, improving over text or visual prompt alone. These results show that simplicity and strong unified prompting capability can be achieved together.