CODE: Cross-Modal Calibration and Dynamic Suppression for Open World Object Detection

📄 arXiv: 2608.27214v1 📥 PDF

作者: Hao Xu, Zhaoning Shi, Hehe Jin, Bo Ma

分类: cs.CV

发布日期: 2026-08-27

备注: Accepted by ACM Multimedia 2026 (MM '26)

DOI: 10.1145/3767308.3836545


💡 一句话要点

提出CODE以解决开放世界物体检测中的语义模糊问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 开放世界物体检测 跨模态校准 动态抑制 多模态融合 不确定性增强

📋 核心要点

  1. 现有的开放世界物体检测方法在处理语义模糊和未知物体时存在显著不足,尤其是在决策边界附近。
  2. 本文提出的CODE框架通过跨模态校准和动态抑制机制,增强了对未知物体的检测能力,解决了现有方法的局限性。
  3. 在Real-World Detection基准测试中,CODE显著提升了检测性能,U-mAP和K-mAP分别提高了2.6和2.3个百分点。

📝 摘要(中文)

开放世界物体检测(OWOD)基于多模态基础模型,常因单向文本与视觉匹配导致语义模糊,而严格的异常值惩罚可能会过度抑制已知类别决策边界附近的未知物体。为此,本文提出了CODE(跨模态校准与动态抑制),一个统一的推理框架,包含三个互补组件:跨模态联合置信度校准、基于不确定性的通用物体性增强和动态异常值抑制。实验结果表明,使用OWL-ViT L/14骨干网络,CODE在任务1中实现了21.7的U-mAP和40.8的K-mAP,分别超越了之前的最优结果2.6和2.3个百分点。

🔬 方法详解

问题定义:本文旨在解决开放世界物体检测中因单向文本与视觉匹配导致的语义模糊问题,以及严格的异常值惩罚对未知物体的过度抑制。

核心思路:CODE框架通过引入跨模态校准和动态抑制机制,增强了对未知物体的检测能力,避免了传统方法的局限性。

技术框架:CODE框架包含三个主要模块:跨模态联合置信度校准、基于不确定性的通用物体性增强和动态异常值抑制,每个模块相辅相成,提升整体检测性能。

关键创新:最重要的创新在于动态异常值抑制机制,通过置信度边际调整,保留了模糊的分布外实例,与传统的严格抑制方法形成鲜明对比。

关键设计:在设计中,跨模态联合置信度校准引入了全局视觉原型,基于不确定性的通用物体性增强则通过局部视觉响应评估分类犹豫,确保潜在未知物体的增强。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在实验中,使用OWL-ViT L/14骨干网络,CODE在任务1中实现了21.7的U-mAP和40.8的K-mAP,分别超越了之前的最优结果2.6和2.3个百分点,显示出显著的性能提升。

🎯 应用场景

该研究的潜在应用领域包括智能监控、自动驾驶、机器人视觉等,能够有效提升系统对未知物体的识别能力,具有重要的实际价值和未来影响力。通过改善开放世界物体检测的性能,CODE可以为多种应用场景提供更可靠的支持。

📄 摘要(原文)

Open World Object Detection (OWOD) built on multimodal foundation models often suffers from semantic ambiguity caused by unidirectional text-to-vision matching, while rigid outlier penalties may over-suppress unknown objects near known-class decision boundaries. We propose CODE (Cross-Modal Calibration and Dynamic Suppression), a unified inference-time framework with three complementary components. Cross-Modal Joint Confidence Calibration injects global visual prototypes to calibrate text-driven known-class predictions. Uncertainty-Guided Universal Objectness Enhancement measures classification hesitation from local visual responses to strengthen potential unknown objects. Dynamic Outlier Suppression via Confidence Margin replaces rigid suppression with a margin-aware adjustment that preserves ambiguous out-of-distribution instances. Experiments on the Real-World Detection benchmark demonstrate that, with the OWL-ViT L/14 backbone, CODE achieves 21.7 U-mAP and 40.8 K-mAP in Task 1, surpassing the previous state of the art by 2.6 and 2.3 points, respectively.