CrossMambaTuning: Synergistic Spatial and Cross-Layer Adaptation for Machine Vision Compression
作者: Haobo Xiong, Shaobo Liu, Kai Liu, Chongyang Ding
分类: cs.CV, cs.AI
发布日期: 2026-08-26
备注: Accepted by ACM MM26
🔗 代码/项目: GITHUB
💡 一句话要点
提出CrossMambaTuning以解决机器视觉压缩中的跨层适应问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 机器视觉 图像压缩 模型适应 跨层交互 参数效率 深度学习
📋 核心要点
- 现有的机器视觉压缩方法在适应预训练模型时,缺乏有效的跨层协调机制,导致性能不足。
- 论文提出的CrossMambaTuning框架通过结合状态空间模型和跨层交互机制,实现了高效的微调。
- 实验结果显示,CrossMambaTuning在多个任务上达到了最先进的性能,参数开销减少了72%。
📝 摘要(中文)
为了降低部署成本和再训练开销,将预训练的学习图像压缩(LIC)模型适应于下游机器视觉任务引起了越来越多的关注。然而,现有方法通常独立地在冻结的主干网络中插入微调模块,缺乏跨层协调的显式机制。为了解决这一局限性,我们提出了一种新颖的框架CrossMambaTuning,该框架结合了状态空间模型和跨层交互机制,实现了参数高效的微调。具体而言,我们设计了一种高效的Mamba适配器,配备了任务特定的提示和多尺度分支,以精确捕捉局部特征和全局依赖。此外,我们引入了一种利用参数共享策略的尺度不变跨层适配器(SICA),以融合不同尺度的任务信息并减少冗余。大量实验表明,CrossMambaTuning在多个机器视觉任务上实现了最先进的性能,相比于现有方法减少了72%的参数开销。
🔬 方法详解
问题定义:本论文旨在解决现有机器视觉压缩方法在适应预训练模型时缺乏跨层协调的问题,导致性能未能达到最佳。
核心思路:CrossMambaTuning框架通过引入状态空间模型和跨层交互机制,旨在实现高效的参数微调,确保不同层次之间的信息能够有效共享和融合。
技术框架:该框架主要包括Mamba适配器和尺度不变跨层适配器(SICA)。Mamba适配器通过任务特定的提示和多尺度分支来捕捉特征,而SICA则通过参数共享策略来减少冗余并融合不同尺度的信息。
关键创新:最重要的创新在于引入了跨层交互机制,使得不同层之间能够有效协调,从而提升了模型的适应能力和性能。与现有方法相比,CrossMambaTuning在参数效率上有显著提升。
关键设计:在设计中,Mamba适配器采用了多尺度分支结构,能够同时处理局部和全局特征;SICA则通过参数共享来减少模型冗余,确保信息的有效融合。
🖼️ 关键图片
📊 实验亮点
CrossMambaTuning在多个机器视觉任务上实现了最先进的性能,相比于现有方法,参数开销减少了72%。这一显著的提升表明该方法在参数效率和性能之间达成了良好的平衡,具有重要的研究和应用价值。
🎯 应用场景
该研究的潜在应用领域包括自动驾驶、智能监控和机器人视觉等机器视觉任务。通过提高模型的适应性和压缩效率,CrossMambaTuning能够在资源受限的环境中实现高效的视觉处理,具有重要的实际价值和广泛的应用前景。
📄 摘要(原文)
To reduce deployment cost and retraining overhead, adapting pretrained learned image compression (LIC) models to downstream machine vision tasks has attracted growing attention. However, existing methods typically insert fine-tuning modules independently into frozen backbones, lacking explicit mechanisms for cross-layer coordination. To address this limitation, we propose a novel framework named CrossMambaTuning, which integrates State Space Models with cross-layer interaction mechanisms for parameter-efficient fine-tuning. Specifically, we design an efficient Mamba adapter equipped with task-specific prompts and multi-scale branching to precisely capture both local features and global dependencies. Furthermore, we introduce a Scale-Invariant Cross-Layer Adapter (SICA) utilizing a parameter-sharing strategy to fuse task information across different scales and reduce redundancy. Extensive experiments demonstrate that CrossMambaTuning achieves state-of-the-art (SOTA) performance on multiple machine vision tasks, reducing parameter overhead by 72\% compared to SOTA methods. Code is available at https://github.com/rsr1123/CrossMambaTuning.