Escaping Low-Dimensional Overlap: Multi-Task Model Merging via High-Dimensional Sparse Disentanglement

📄 arXiv: 2608.25354v1 📥 PDF

作者: Yihang Zhang, Shengke Sun, Junjie Wen, Feng Zeng

分类: cs.LG, cs.AI, cs.CL

发布日期: 2026-08-26


💡 一句话要点

提出稀疏表示合并框架以解决多任务模型重叠问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 模型合并 多任务学习 稀疏表示 特征解耦 优化算法

📋 核心要点

  1. 现有的模型合并方法在严重任务干扰下性能下降,主要由于任务特征的重叠导致有效特征难以分离。
  2. 本文提出了一种基于稀疏自编码器的合并框架,通过高维稀疏特征空间实现任务特征的解耦,提升合并效果。
  3. 在Qwen2.5-1.5B和Qwen2.5-7B上进行的实验表明,该方法在多个任务上均显著优于现有基线,尤其在复杂任务设置中表现突出。

📝 摘要(中文)

模型合并为构建多任务通用模型提供了一种高效的方法,但在严重任务干扰下,其性能往往会下降。任务干扰主要源于特征的重叠,使得传统的分解方法无法有效隔离有用的任务方向。本文提出了一种基于稀疏表示的合并框架,利用稀疏自编码器将任务向量投影到高维稀疏特征空间,从而在融合前实现特征级的解耦。为降低计算开销,我们进一步引入了一种轻量级的分组排名零阶优化器(GR-ZOO),以识别关键任务层进行选择性合并。实验结果表明,该方法在多个任务上均优于代表性基线,尤其在高冲突的四任务设置中,取得了2.78%的性能提升。

🔬 方法详解

问题定义:本文旨在解决多任务模型合并中由于任务干扰导致的性能下降问题。现有方法在特征重叠情况下难以有效分离任务特征,影响合并效果。

核心思路:提出基于稀疏表示的合并框架,通过稀疏自编码器将任务向量投影到高维稀疏特征空间,实现特征级解耦,从而提高合并后的模型性能。

技术框架:整体架构包括两个主要模块:稀疏自编码器用于特征解耦,分组排名零阶优化器(GR-ZOO)用于识别关键任务层,确保合并过程的高效性。

关键创新:最重要的创新在于引入稀疏自编码器进行特征解耦,解决了传统方法在特征重叠情况下的不足,显著提升了合并效果。

关键设计:在设计中,稀疏自编码器的参数设置经过优化,以确保特征的有效解耦;GR-ZOO优化器则通过轻量级的计算方式识别关键层,降低了计算开销。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,提出的方法在Qwen2.5-1.5B和Qwen2.5-7B上均优于多个基线方法,包括Task Arithmetic、TIES-Merge等。在高冲突的四任务设置中,取得了2.78%的性能提升,验证了方法的有效性。

🎯 应用场景

该研究的潜在应用领域包括多任务学习、模型压缩和迁移学习等。通过有效的模型合并,可以在资源受限的环境中构建高效的多任务通用模型,具有重要的实际价值和广泛的应用前景。

📄 摘要(原文)

Model merging provides an efficient way to construct multi-task generalist models without additional training, but its performance often degrades under severe task interference. Task interference in model merging primarily stems from \textit{superposition}, where task-specific features become entangled within the parameter space. This entanglement renders conventional decomposition methods insufficient for effectively isolating useful task directions from interfering components. In this paper, we propose a sparse-representation-based merging framework that uses Sparse Autoencoders (SAEs) to project task vectors into a high-dimensional sparse feature space, enabling feature-level disentanglement before fusion. To reduce computational overhead, we further introduce a lightweight Group-Ranked Zeroth-Order Optimizer (GR-ZOO) to identify task-critical layers for selective merging. Experiments on both Qwen2.5-1.5B and Qwen2.5-7B demonstrate that our method consistently outperforms representative baselines, including Task Arithmetic, TIES-Merge, DARE, Fisher-Merge,and several recent training-free merging methods, across mathematical reasoning, code generation, instruction following, and general knowledge tasks. In a highly conflicting four-task setting on Qwen2.5-1.5B, our method further achieves a 2.78\% improvement over the strongest baseline.