S$^3$AM: A Single-Stream SAM with Reliability-Calibrated Frequency Adapter for Multi-modal Salient Object Detection
作者: Ruichao Hou, Boyue Xu, Tongwei Ren, Dongming Zhou, Gangshan Wu, Jinde Cao
分类: cs.CV
发布日期: 2026-08-18
🔗 代码/项目: GITHUB
💡 一句话要点
提出单流SAM框架以解决多模态显著目标检测中的冗余计算问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态显著目标检测 单流框架 可靠性校准 频率适配器 参数高效
📋 核心要点
- 现有的多模态显著目标检测方法通常依赖双流编码器,导致计算冗余和效率低下。
- 本文提出了一种单流框架,通过可靠性校准频率适配器优化SAM主干,减少冗余计算。
- 在RGB-D、RGB-T和RGB-NIR基准上进行的实验表明,该方法在性能上具有竞争力,参数量显著减少。
📝 摘要(中文)
视觉基础模型最近通过参数高效调优和提示学习推动了多模态显著目标检测(MSOD)的发展。然而,现有的基于Segment Anything Model(SAM)的MSOD方法通常依赖于双流编码器或辅助提示生成器,导致冗余计算。虽然单流替代方案可以降低成本,但早期融合可能会将噪声或不对齐的高频信息传播到主干网络中。本文提出了一种新颖的单流框架,将可靠性校准频率适配器集成到采用的SAM主干中,以避免重复的基础主干,同时显式控制辅助频率的注入。具体而言,我们设计了一种频率专家混合模块,利用静态小波变换分解每种模态并聚合跨模态频率信息。我们进一步引入了具有双门校准机制的可靠性校准频率适配器,选择性地在变换器阶段传播校准残差,同时共同控制其注入强度和跨模态可靠性。综合实验验证了该框架在多个基准上的竞争性能,仅需12.20M可训练参数,占总参数的5.4%。
🔬 方法详解
问题定义:本文旨在解决现有多模态显著目标检测方法中因双流编码器或辅助提示生成器导致的冗余计算和噪声传播问题。现有方法在计算效率和准确性上存在不足。
核心思路:提出的单流框架通过集成可靠性校准频率适配器,避免了重复的基础主干,同时控制辅助频率的注入,从而提高了计算效率和检测精度。
技术框架:整体架构包括频率专家混合模块、可靠性校准频率适配器和超网络引导的语义结构解码器。频率专家模块负责模态分解和信息聚合,校准适配器则在变换器阶段选择性传播信息。
关键创新:最重要的创新在于引入了双门校准机制的可靠性校准频率适配器,能够有效控制信息的传播强度和跨模态的可靠性,这在现有方法中尚未实现。
关键设计:设计中使用了静态小波变换进行模态分解,确保频率信息的有效聚合。同时,参数设置经过精心调整,以实现最佳的性能与效率平衡。实验中仅使用12.20M可训练参数,显示出良好的参数效率。
🖼️ 关键图片
📊 实验亮点
实验结果表明,所提出的框架在多个基准上表现出色,性能与现有方法相比具有竞争力。具体而言,模型仅使用12.20M可训练参数,显著降低了计算成本,同时保持了高效的检测精度。
🎯 应用场景
该研究的潜在应用领域包括智能监控、自动驾驶、机器人视觉等多模态感知任务。通过提高显著目标检测的效率和准确性,该方法能够在实际应用中提供更可靠的视觉理解,推动相关技术的发展。
📄 摘要(原文)
Vision foundation models have recently advanced multi-modal salient object detection (MSOD) through parameter-efficient tuning and prompt learning. However, existing Segment Anything Model (SAM)-adapted MSOD methods often rely on dual-stream encoders or auxiliary prompt generators, leading to redundant computation. Although a single-stream alternative can reduce this cost, early fusion may also propagate noisy or misaligned auxiliary high-frequency cues through the backbone. In this paper, we propose a novel single-stream framework that integrates reliability-calibrated frequency adaptation into the adopted SAM backbone for MSOD. It avoids duplicated foundation backbones while explicitly controlling auxiliary frequency injection. Specifically, we design a mixture of frequency experts module, which uses the stationary wavelet transform to decompose each modality and aggregate cross-modal frequency information. We further introduce a reliability-calibrated frequency adapter with a dual-gate calibration mechanism, which selectively propagates the calibrated residual across transformer stages while jointly controlling its injection strength and cross-modal reliability. A hypernetwork-guided semantic-structural decoder then combines semantic mask features from the adopted backbone with Mamba-based structural detail recovery. Comprehensive experiments on RGB-D, RGB-T, and RGB-NIR salient object detection benchmarks validate that the proposed framework achieves competitive performance with only 12.20M trainable parameters, accounting for 5.4\% of the total parameters. The code will be available at https://github.com/xuboyue1999/SSSAM.