CoRe-MoE: Compact Reusable MoE for Continual Multimodal Instruction Tuning
作者: Runze Liu, Naibin Gu, Mingxu Ai, Yuqing Li, Peng Fu, Zheng Lin, Weiping Wang
分类: cs.AI
发布日期: 2026-08-28
备注: Accepted to Findings of EMNLP 2026
🔗 代码/项目: GITHUB
💡 一句话要点
提出CoRe-MoE以解决持续多模态指令调优中的参数冗余问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 持续学习 多模态指令调优 参数效率 专家模型 低秩路由器
📋 核心要点
- 现有的LoRA-MoE方法在每个新任务上都需要扩展完整的专家,导致参数开销过大。
- CoRe-MoE通过提取可重用的输入和输出方向基,结合任务特定的低秩路由器,实现了参数高效的调优。
- 实验结果显示,CoRe-MoE在性能上优于最强基线,且参数使用效率显著提升。
📝 摘要(中文)
持续多模态指令调优要求多模态大语言模型能够顺序获取新任务能力,同时保留先前学习的知识。LoRA-MoE通过引入基于专家的能力提供了一个有前景的解决方案,但重复学习和维护完整的LoRA专家会导致显著的参数开销。为此,本文提出了CoRe-MoE,一个紧凑可重用的MoE框架,旨在实现参数高效的持续多模态指令调优。CoRe-MoE从初始专家库中提取可重用的输入和输出方向基,并为后续任务仅训练紧凑的坐标专家及任务特定的低秩路由器。实验结果表明,CoRe-MoE在两个代表性多模态大语言模型上,最终平均性能比最强竞争基线提高了最多5.90分,同时使用的可训练参数不足顺序LoRA的1%。
🔬 方法详解
问题定义:本文旨在解决持续多模态指令调优中,重复学习和维护完整LoRA专家导致的参数冗余问题。现有方法在每个新任务上都需要扩展完整的专家,造成显著的参数开销。
核心思路:CoRe-MoE的核心思想是通过分析任务特定LoRA更新的SVD,发现输入和输出方向子空间之间存在显著重叠,从而提取可重用的方向基,减少参数使用。
技术框架:CoRe-MoE框架包括初始专家库的构建、可重用方向基的提取、紧凑坐标专家的训练以及任务特定的低秩路由器的设计。整体流程通过这些模块实现高效的参数利用。
关键创新:CoRe-MoE的主要创新在于提出了可重用的输入和输出方向基的概念,显著减少了每个新任务所需的参数量,与传统的LoRA-MoE方法相比,降低了参数冗余。
关键设计:在设计上,CoRe-MoE采用了低秩路由器来动态选择适合当前任务的专家,同时通过紧凑坐标专家来实现高效的任务适应,确保了模型的灵活性与效率。
🖼️ 关键图片
📊 实验亮点
实验结果表明,CoRe-MoE在两个代表性多模态大语言模型上,最终平均性能比最强竞争基线提高了最多5.90分,同时可训练参数使用量不足顺序LoRA的1%。这一显著提升展示了其在参数效率和性能上的优势。
🎯 应用场景
该研究具有广泛的应用潜力,尤其在需要持续学习和适应新任务的多模态系统中,如智能助手、自动驾驶和人机交互等领域。通过提高模型的参数效率,CoRe-MoE可以降低计算资源消耗,提升系统的响应速度和灵活性,具有重要的实际价值和未来影响。
📄 摘要(原文)
Continual multimodal instruction tuning requires multimodal large language models to acquire new task abilities sequentially while preserving previously learned knowledge. LoRA-MoE provides a promising solution by introducing expert-based capacity, but repeatedly learning and maintaining full LoRA experts leads to substantial parameter overhead. This raises a natural question: is full expert expansion necessary for every new task? To answer it, we analyze the SVD of task-specific LoRA updates and observe substantial overlap in their input- and output-side LoRA direction subspaces, with task-specific adaptation largely captured by lightweight coordinates over these subspaces. Motivated by this observation, we propose CoRe-MoE, a Compact Reusable MoE framework for parameter-efficient continual multimodal instruction tuning. CoRe-MoE extracts reusable input- and output-side direction bases from an initial expert bank, and for subsequent tasks trains only compact coordinate experts together with task-specific low-rank routers. Experiments on two representative MLLMs show that CoRe-MoE improves final average performance over the strongest competing baseline by up to 5.90 points, while using less than 1% of the trainable parameters required by sequential LoRA for later tasks. The code is publicly available at https://github.com/runzezz/CoRe-MoE.