Semantically Compatible Knowledge Distillation for Cross-Domain Object Detection with Vision Foundation Models

📄 arXiv: 2608.20916v1 📥 PDF

作者: Qifeng Zhang, Ting Xiang, Zeyuan Bai, Changjian Chen

分类: cs.CV

发布日期: 2026-08-21


💡 一句话要点

提出语义兼容知识蒸馏框架以解决跨域目标检测问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 跨域目标检测 知识蒸馏 视觉基础模型 特征对齐 伪标签学习 深度学习

📋 核心要点

  1. 现有基于视觉基础模型的方法未能有效处理教师与学生特征图之间的空间尺度差异,导致语义不兼容。
  2. 本文提出的SLE-T框架通过引入SLE适配器,增强了教师模型的语义兼容性,从而改善了跨域目标检测的效果。
  3. 实验结果显示,SLE-T在多个基准测试中表现出色,DINOv2-B在训练时间和GPU内存使用上均显著优于DINOv2-G。

📝 摘要(中文)

视觉基础模型(VFM)在领域自适应目标检测(DAOD)中展现出强大的泛化能力。然而,现有基于VFM的方法忽视了教师与学生特征图之间的空间尺度差异,导致语义不兼容,从而削弱了特征对齐和伪标签学习的效果。此外,领域转移可能导致源域训练的VFM教师无法识别目标域对象,限制了伪标签的质量。为了解决这些问题,本文提出了语义定位增强教师(SLE-T),这是一个围绕轻量级SLE适配器构建的语义兼容知识蒸馏框架。SLE适配器将预训练的局部纹理先验注入DINOv2,以改善跨域识别,并将其特征重构为在空间和语义上与学生检测器兼容的密集表示。SLE-T通过伪标签学习或特征对齐转移教师知识。实验表明,该方法在三个DAOD基准上实现了最先进的性能,并确认了教师与学生语义兼容性的重要性。

🔬 方法详解

问题定义:本文旨在解决跨域目标检测中教师与学生特征图之间的空间尺度差异和语义不兼容问题。现有方法在处理领域转移时,往往无法有效识别目标域对象,导致伪标签质量下降。

核心思路:提出的SLE-T框架通过引入轻量级的SLE适配器,注入预训练的局部纹理先验,以增强教师模型的语义兼容性,从而提高跨域识别能力。

技术框架:SLE-T框架主要包括SLE适配器和知识转移模块。SLE适配器负责将DINOv2的特征重构为在空间和语义上与学生检测器兼容的密集表示,而知识转移模块则通过伪标签学习或特征对齐将教师知识传递给学生模型。

关键创新:SLE-T的核心创新在于引入了语义定位增强的思想,使得教师模型的特征在空间和语义上与学生模型保持一致,从而有效提升了目标检测的性能。

关键设计:在模型设计中,SLE适配器的参数设置经过精心调整,以确保其能够有效注入局部纹理先验。此外,损失函数的设计也考虑了教师与学生之间的语义兼容性,确保知识蒸馏过程的有效性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,SLE-T在三个DAOD基准上实现了最先进的性能,DINOv2-B在训练时间上仅为DINOv2-G的四分之一,同时显著减少了GPU内存使用,展示了高效的知识转移能力。

🎯 应用场景

该研究的潜在应用领域包括自动驾驶、监控系统和机器人视觉等,能够显著提升跨域目标检测的准确性和效率。随着技术的进步,SLE-T框架有望在实际应用中发挥更大的价值,推动智能视觉系统的发展。

📄 摘要(原文)

Vision foundation models (VFMs) offer strong generalization capabilities for domain-adaptive object detection (DAOD). However, existing VFM-based methods overlook the spatial-scale discrepancy between teacher and student feature maps, resulting in semantic incompatibility that weakens both feature alignment and pseudo-label learning. Moreover, domain shift can cause source-trained VFM teachers to miss target-domain objects, limiting the quality of their pseudo-labels. To address these issues, we propose the Semantic Localization-Enhanced Teacher (SLE-T), a semantically compatible knowledge-distillation framework built around a lightweight SLE Adapter for DINOv2. SLE Adapter injects pretrained local-texture priors into DINOv2 to improve cross-domain recognition and reformulates its features into dense representations that are spatially and semantically compatible with the student detector. SLE-T transfers the resulting teacher knowledge through either pseudo-label learning or feature alignment. We instantiate SLE-T with DINOv2-B and DINOv2-L (the ViT-B and ViT-L variants) and compare them with the larger DINOv2-G teacher. Extensive experiments on three DAOD benchmarks demonstrate that our method achieves state-of-the-art performance, and ablation studies confirm the importance of teacher-student semantic compatibility. Notably, SLE-T with DINOv2-B produces competitive or superior pseudo-labels using approximately one-quarter of the training time of DINOv2-G and substantially less GPU memory, demonstrating efficient VFM knowledge transfer under limited computational resources.