ADGNet: Asymmetric Dual-text Guided Network for Infrared Small Target Detection

📄 arXiv: 2609.00853v1 📥 PDF

作者: Tongtong Wang, Mingzhu Xu, Chenglong Yu, Jing Wang, Xiaohui Lin, Weili Guan

分类: cs.CV, cs.AI

发布日期: 2026-09-01

备注: 10 pages, 10 figures. Accepted by the 34th ACM International Conference on Multimedia (ACM Multimedia 2026)

🔗 代码/项目: GITHUB


💡 一句话要点

提出ADGNet以解决红外小目标检测中的背景干扰问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 红外小目标检测 多模态学习 特征聚合 深度学习 背景抑制

📋 核心要点

  1. 现有的红外小目标检测方法在处理背景杂波时表现不佳,难以有效区分目标与背景。
  2. 本文提出的ADGNet通过设计非对称双文本提示和双分支交互模块,分别引导视觉特征,增强目标检测能力。
  3. 实验结果显示,ADGNet在多个数据集上超越21种最先进的方法,显著提高了检测精度。

📝 摘要(中文)

红外小目标检测(IRSTD)是一项具有挑战性的任务。现有的视觉方法仅依赖像素级信息,难以在杂波中区分目标。当前的多模态方法通常使用单一文本提示描述目标和背景,缺乏专门的区域指导,忽视了红外语义的不对称性。因此,这种方法提供的背景抑制信息不足,导致小目标被噪声淹没。为了解决这些问题,本文提出了一种新颖的非对称双文本引导网络(ADGNet)。该网络设计了非对称双文本提示(ADP),并引入了非对称双分支交互模块(ADBI)和自适应特征聚合模块(AFA),以有效抑制背景杂波并保护目标。实验表明,ADGNet在21种最先进的方法中表现优异。

🔬 方法详解

问题定义:本文旨在解决红外小目标检测中背景杂波对目标识别的干扰问题。现有方法往往依赖单一文本提示,无法有效抑制背景噪声,导致小目标检测性能下降。

核心思路:ADGNet通过引入非对称双文本提示(ADP),分别提供针对目标和背景的文本信息,从而实现更精确的特征引导,减少噪声干扰。

技术框架:ADGNet的整体架构包括三个主要模块:非对称双文本提示(ADP)、非对称双分支交互模块(ADBI)和自适应特征聚合模块(AFA)。ADP为目标和背景提供不同的文本指导,ADBI则通过双分支结构分别处理这些信息,最后AFA动态融合两个分支的特征。

关键创新:ADGNet的核心创新在于引入了非对称双文本提示和双分支交互模块,这种设计有效解决了现有方法中背景干扰与目标特征优化冲突的问题。

关键设计:在网络结构上,ADGNet采用了双分支架构,每个分支对应不同的文本提示。此外,损失函数设计上考虑了目标与背景的特征差异,以优化模型的学习效果。特征聚合模块则通过动态权重调整,增强了模型对小目标的敏感性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

ADGNet在多个公开数据集(如IRSTD-1K、NUDT-SIRST和SIRST)上进行的实验表明,其性能超越了21种最先进的方法,具体提升幅度达到XX%(具体数据未知),显示出显著的背景抑制能力和目标检测精度。

🎯 应用场景

该研究在红外成像、安防监控、无人驾驶等领域具有广泛的应用潜力。通过提高小目标的检测能力,ADGNet能够有效提升相关系统的智能化水平,增强其在复杂环境中的适应性和可靠性。

📄 摘要(原文)

InfRared Small Target Detection (IRSTD) is a challenging task. Relying solely on pixel-level information, vision-only methods struggle to distinguish targets from clutter. Current multimodal methods typically describe both targets and backgrounds with a single textual prompt. Such an approach lacks dedicated regional guidance and ignores infrared semantic asymmetry. Consequently, it provides insufficient background suppression information and introduces severe feature optimization conflicts, overwhelming small targets with noise. To address these issues, we propose a novel Asymmetric Dual-text Guided Network (ADGNet). Specifically, accounting for the infrared semantic asymmetry, we first design the Asymmetric Dual-text Prompt (ADP), comprising an image-agnostic abstract target prompt and an image-specific detailed background prompt. To leverage these prompts, we introduce an Asymmetric Dual-Branch Interaction (ADBI) module to separately guide visual features with their respective text priors, protecting targets from noise while suppressing background clutter. Subsequently, we introduce an Adaptive Feature Aggregation (AFA) module to dynamically fuse features from the two branches. Furthermore, we construct a multimodal Asymmetric Image-Text Infrared (AITIR) dataset by providing asymmetric text annotations for three public datasets (IRSTD-1K, NUDT-SIRST, and SIRST). Extensive experiments demonstrate that ADGNet outperforms 21 state-of-the-art (SOTA) methods. Code is available at https://github.com/iLearn-Lab/MM26-ADGNet.