Self-Routed Tensor Adapters for Parameter-Efficient Universal Visual Adaptation
作者: Suraj Yadav
分类: cs.CV, cs.LG
发布日期: 2026-08-17
备注: Accepted at ECCV Workshop 2026 (Archival Track)
🔗 代码/项目: GITHUB
💡 一句话要点
提出自路由张量适配器以解决多领域视觉适应问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 视觉适应 参数高效 多领域学习 自路由机制 深度学习
📋 核心要点
- 现有的参数高效微调方法在处理多领域视觉适应时,往往因固定的低秩适配器而受到限制,无法有效应对领域间的差异。
- 论文提出的自路由张量适配器(SRTA)通过使用可学习的领域矩阵计算路由权重,生成样本特定的适应矩阵,避免了外部路由器的复杂性。
- 实验结果表明,SRTA在多个多领域视觉分类基准上表现优异,使用的可训练参数显著少于现有的MoE风格基线,同时准确率相当或更高。
📝 摘要(中文)
通用视觉表示需要适应机制,以便在异构领域中进行适应,而不将知识分散到特定领域的模块中。参数高效的微调方法能够有效地适应冻结的视觉基础模型,但标准的低秩适配器对所有输入使用固定的子空间,这在领域风格、背景和语义上下文差异较大时可能会受到限制。基于MoE的适配器通过多个专家路径改善专业化,但通常依赖外部路由器和大型专家库,增加了参数并将路由与适应分离。我们提出了自路由张量适配器(SRTA),这是一个紧凑的多领域视觉适应框架。SRTA将每个输入投影到低秩空间,使用可学习的领域矩阵计算路由权重,并利用这些权重混合共享的Tucker核心切片,从而生成特定样本的适应矩阵,无需外部门控网络,允许重用共享视觉因素,同时支持领域感知的专业化。在五个异构多领域视觉分类基准上,SRTA在使用显著更少的可训练参数的情况下,达到了与MoE风格PEFT基线相当或略强的平均准确率。
🔬 方法详解
问题定义:本论文旨在解决在多领域视觉适应中,现有方法因固定的低秩适配器而导致的适应能力不足的问题。现有的MoE适配器虽然能改善专业化,但增加了参数和复杂性。
核心思路:论文提出的自路由张量适配器(SRTA)通过将输入投影到低秩空间,并利用可学习的领域矩阵计算路由权重,从而生成样本特定的适应矩阵,避免了外部门控网络的需求。
技术框架:SRTA的整体架构包括输入投影、路由权重计算和适应矩阵生成三个主要模块。首先,将输入映射到低秩空间;然后,使用领域矩阵计算路由权重;最后,利用这些权重混合共享的Tucker核心切片。
关键创新:SRTA的核心创新在于其自路由机制,允许在不依赖外部路由器的情况下实现领域感知的适应。这一设计使得共享视觉因素得以重用,同时支持不同领域的专业化。
关键设计:在参数设置上,SRTA在4领域设置下使用2.77M参数,而在6领域设置下使用3.00M参数,相比于MoLoRA的9.52M和14.31M,显著减少了可训练参数。损失函数和网络结构设计上,SRTA引入了渐进深度加权路由目标,以监督适配器层间的路由决策。
🖼️ 关键图片
📊 实验亮点
在五个异构多领域视觉分类基准上,SRTA的平均准确率与MoE风格的PEFT基线相当或略高。在4领域设置下,SRTA使用2.77M参数,而MoLoRA使用9.52M参数,显示出显著的参数效率提升。在6领域设置下,SRTA使用3.00M参数,相比于MoLoRA的14.31M,进一步验证了其优势。
🎯 应用场景
自路由张量适配器(SRTA)在多领域视觉适应中具有广泛的应用潜力,尤其是在需要处理多样化视觉数据的任务中,如自动驾驶、医疗影像分析和智能监控等领域。通过有效的参数利用,SRTA能够在资源受限的环境中实现高效的视觉模型适应,推动相关领域的技术进步。
📄 摘要(原文)
Universal visual representations require adaptation mechanisms that adapt across heterogeneous domains without fragmenting knowledge into domain-specific modules. Parameter-efficient fine-tuning adapts frozen visual foundation models efficiently, but standard low-rank adapters use a fixed subspace for all inputs, which can be restrictive when domains differ in style, background, and semantic context. MoE-based adapters improve specialization through multiple expert pathways, but often rely on external routers and large expert banks, adding parameters and separating routing from adaptation. We propose \textbf{Self-Routed Tensor Adapters}, a compact framework for multi-domain visual adaptation. SRTA projects each input into a low-rank space, computes routing weights from this representation using a learnable domain matrix, and uses these weights to blend slices of a shared Tucker core. This produces a sample-specific adaptation matrix without an external gating network, allowing shared visual factors to be reused while supporting domain-aware specialization. To strengthen pathway learning, we introduce a progressive depth-weighted routing objective that supervises routing decisions across adapter layers. Across five heterogeneous multi-domain visual classification benchmarks, SRTA achieves competitive or slightly stronger average accuracy than MoE-style PEFT baselines while using substantially fewer trainable parameters. At rank 64, SRTA uses 2.77M parameters in the 4-domain setting compared with 9.52M for MoLoRA, and 3.00M in the 6-domain setting compared with 14.31M. Overall, SRTA offers an effective accuracy-parameter trade-off for adapting visual foundation models toward universal multi-domain representations. \href{https://github.com/surajyadav-research/SRTA}{GitHub}