EGM-Det: Entropy-Guided Multimodal Adaptive Fusion for UAV RGB-IR Object Detection
作者: Cunzheng Fan, Dawei Yan, Guanlin Wang, Xingshuo Yang, Yupeng Jia, Jing Yang, Haokui Zhang
分类: cs.CV
发布日期: 2026-08-12
备注: 14 pages, 7 figures, 6 tables
💡 一句话要点
提出EGM-Det以解决UAV RGB-IR目标检测中的模态融合问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: RGB-IR目标检测 多模态融合 熵引导 自适应融合 无人机技术 深度学习 交叉模态蒸馏
📋 核心要点
- 现有的RGB-IR目标检测方法多采用固定权重进行模态融合,无法有效应对模态可靠性的空间变化。
- EGM-Det通过熵引导的自适应融合框架,利用双流架构和熵偏移门融合模块,动态选择可靠的模态信息。
- 在DroneVehicle、LLVIP和VEDAI数据集上的实验结果显示,EGM-Det的性能超过了现有方法,特别是在VEDAI上提升超过10个百分点。
📝 摘要(中文)
联合使用RGB和红外(IR)图像可以提高无人机视角下的目标检测性能,但现有方法通常采用静态或固定权重进行多模态特征融合,忽视了模态可靠性的空间变化。为此,本文提出了EGM-Det,一个基于熵引导的多模态自适应融合框架。EGM-Det采用双流架构以保留模态特定表示,并引入熵偏移门融合模块进行自适应多尺度融合。该模块从输入强度、局部熵和跨模态差异中推导浅层熵先验,并利用这些先验指导局部偏移对齐和空间通道门控融合,从而选择性地聚合可靠的RGB和红外线线索,而不是均匀地组合异构特征。实验结果表明,EGM-Det在DroneVehicle、LLVIP和VEDAI三个基准上均表现出最先进的性能,特别是在VEDAI上超越了之前的方法超过10个百分点。
🔬 方法详解
问题定义:本文旨在解决无人机RGB-IR目标检测中模态融合的有效性问题。现有方法往往使用固定权重进行模态特征融合,无法适应不同场景下模态的可靠性变化,导致检测性能下降。
核心思路:EGM-Det的核心思路是通过熵引导的自适应融合来动态调整模态信息的融合方式。通过引入熵偏移门融合模块,EGM-Det能够根据输入图像的特征和模态间的差异,选择性地聚合可靠的RGB和红外特征。
技术框架:EGM-Det采用双流架构,分别处理RGB和红外图像。熵偏移门融合模块负责多尺度特征的自适应融合,利用局部熵和跨模态差异来指导特征的对齐和融合。
关键创新:EGM-Det的主要创新在于熵引导的自适应融合机制,能够根据模态的可靠性动态调整融合策略。这一方法与传统的静态融合方法本质上不同,能够更好地应对复杂环境下的目标检测任务。
关键设计:在设计上,EGM-Det引入了熵偏移门融合模块,利用输入强度、局部熵和模态间差异来生成熵先验。此外,交叉模态蒸馏技术被用于正则化学习的融合门,以减少融合过程中的性能退化。
🖼️ 关键图片
📊 实验亮点
EGM-Det在DroneVehicle、LLVIP和VEDAI三个基准数据集上均表现出色,特别是在VEDAI数据集上,性能提升超过10个百分点,显著优于现有方法,展示了其在多模态目标检测中的有效性和先进性。
🎯 应用场景
该研究的潜在应用领域包括无人机监控、搜索与救援、环境监测等场景。通过提高RGB-IR目标检测的准确性,EGM-Det能够在复杂环境中更有效地识别和跟踪目标,具有重要的实际价值和广泛的应用前景。
📄 摘要(原文)
Joint use of RGB and infrared (IR) imagery can improve UAV-view object detection, but most existing methods fuse multimodal features with static or fixed weights and therefore overlook spatially varying modality reliability. We propose EGM-Det, an entropy-guided multimodal adaptive fusion framework for RGB-IR object detection. EGM-Det employs a dual-stream architecture to preserve modality-specific representations and introduces an Entropy Offset Gate Fusion module for adaptive multi-scale fusion. The module derives shallow entropy priors from input intensity, local entropy, and cross-modal discrepancy, and uses them to guide local offset alignment and spatial-channel gated fusion. It therefore selectively aggregates reliable RGB and infrared cues instead of uniformly combining heterogeneous features. We further introduce cross-modal distillation to regularize the learned fusion gates and reduce fusion degradation. Each student branch extracts complementary knowledge from the cross-modality teacher branch matched to the main branch, while entropy-adaptive supervision emphasizes uncertain modality decisions. Experiments on DroneVehicle, LLVIP, and VEDAI demonstrate state-of-the-art performance across all three benchmarks; in particular, EGM-Det outperforms prior approaches by more than 10 percentage points on VEDAI.