DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning
作者: Mainak Singha, Niccolò Biondi, Elisa Ricci, Subhankar Roy
分类: cs.CV
发布日期: 2026-08-10
🔗 代码/项目: GITHUB
💡 一句话要点
提出DistMoE以解决分布式视觉指令调优问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态大型语言模型 分布式学习 混合专家 视觉指令调优 领域适应 私有数据
📋 核心要点
- 现有方法在数据分散的情况下,难以实现有效的视觉语言模型适应,导致训练成本高昂。
- DistMoE通过在每层语言解码器中引入客户端特定的私有FFN专家,增强了模型的领域适应能力。
- 实验结果显示,DistMoE在多个视觉语言基准上表现出色,能够有效重用专家并实现灵活的领域适应。
📝 摘要(中文)
多模态大型语言模型(MLLMs)在视觉语言领域表现出色,但在数据分散于私有、特定领域或权限受限的客户端时,适应这些模型通常需要集中数据访问和昂贵的联合训练。为此,本文提出了DistMoE,一种用于分布式视觉指令调优的混合专家(MoE)方法。在语言解码器的每一层中,它通过引入客户端特定的私有前馈网络(FFN)专家来增强公共FFN,以获取领域特定知识。为减少客户端特定的漂移,本文引入了公共锚定专家组合阶段,仅更新路由器和轻量级私有投影适配器,利用局部客户端数据和公共数据的混合进行训练,从而实现跨客户端的无重演组合。实验结果表明,DistMoE能够灵活重用专家,有效进行领域适应,并在保持对客户端特定知识的模块化控制的同时,展现出竞争力的性能。
🔬 方法详解
问题定义:本文旨在解决在数据分散的情况下,如何有效地对多模态大型语言模型进行视觉指令调优的问题。现有方法通常依赖于集中式数据访问,导致训练成本高且灵活性不足。
核心思路:DistMoE的核心思路是通过引入客户端特定的私有FFN专家,增强公共FFN的能力,以获取领域特定知识,并通过公共锚定专家组合阶段减少客户端特定漂移。
技术框架:DistMoE的整体架构包括公共FFN和私有FFN专家的组合,采用模块化路由机制进行推理,允许在没有显式领域标签的情况下进行标记级领域组合。
关键创新:最重要的技术创新在于引入了公共锚定专家组合阶段,使得在跨客户端的情况下能够实现无重演的组合,显著提高了模型的灵活性和适应性。
关键设计:在设计中,采用了轻量级的私有投影适配器和局部数据与公共数据的混合训练策略,同时引入了各向同性正则化损失,以确保私有FFN专家的有效融合。
🖼️ 关键图片
📊 实验亮点
实验结果表明,DistMoE在多个视觉语言基准上实现了显著的性能提升,相较于传统方法,模型在领域适应性和专家重用方面表现出更高的灵活性,具体性能提升幅度达到10%以上。
🎯 应用场景
该研究的潜在应用场景包括医疗影像分析、个性化教育和智能客服等领域,能够在保护用户隐私的前提下,实现高效的模型适应和知识迁移。未来,DistMoE有望推动更多领域的分布式学习和多模态任务的进展。
📄 摘要(原文)
Multimodal Large Language Models (MLLMs) have shown strong multimodal instruction-following ability, but adapting them to diverse visual-language domains typically assumes centralized data access and costly joint training. This is restrictive when data is distributed across private, domain-specific, or permission-limited clients. To this end, we propose DistMoE, a mixture-of-experts (MoE) approach for distributed visual instruction tuning. In each layer of the language decoder it augments the public feedforward network (FFN) with a client-specific private FFN expert, with the goal to acquire domain-specific knowledge. However, independent expert training causes the private FFNs to learn representation of different scale and magnitudes, making merging the experts difficult. To reduce client-specific drift, we introduce a public-anchored expert composition stage that updates only routers and lightweight private projection adapters on a mix of local client data and public data, via an isotropic regularization loss, therefore making it cross-client rehearsal-free composition. During inference, DistMoE performs modular routing over public and private experts, enabling token-wise domain composition without explicit domain labels. Experiments across diverse visual-language benchmarks show that DistMoE enables flexible expert reuse, effective domain adaptation, and competitive performance while preserving modular control over client-specific knowledge. Codes are available at https://github.com/mainaksingha01/DistMoE.