PCoMoE: Shifting MoE Inference from Monolithic Expert Selection to Fine-Grained Path Composition

📄 arXiv: 2609.01024v1 📥 PDF

作者: Ziyan Gan, Fangxin Liu, Chenyang Guan, Junjie Wang, Ning Yang, Haomin Li, Xiang Li, Siran Yang, Jiamang Wang, Lin Qu, Zongwu Wang, Li Jiang, Haibing Guan

分类: cs.CL

发布日期: 2026-09-01

备注: Accepted to EMNLP 2026 Main Conference

🔗 代码/项目: GITHUB


💡 一句话要点

提出PCoMoE以解决MoE推理中的专家选择问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 混合专家 路径组合 推理优化 模型加速 计算效率 层级修剪 大语言模型

📋 核心要点

  1. 现有的MoE推理方法在专家选择上过于粗糙,导致计算效率低下和资源浪费。
  2. PCoMoE通过路径组合的方式,细化了专家的选择过程,从而提升了计算效率。
  3. 实验结果显示,PCoMoE在推理速度上提升了1.31倍,同时模型准确率提高了10%。

📝 摘要(中文)

混合专家(MoE)架构通过每个token激活稀疏的专家子集来高效扩展大语言模型(LLM)的容量。然而,现代MoE推理仍然受到整体专家抽象的限制。现有框架将专家作为原子执行单元进行管理、调度或修剪,过早固定了优化边界,导致细粒度的专家内部计算冗余未被充分探索。本文提出了PCoMoE,一个路径组合执行框架,将MoE推理从粗粒度的专家选择转变为细粒度的路径组合。PCoMoE结合了专家计算的路径级公式、兼容性感知的层级修剪策略以抑制低价值路径组合,以及一个硬件友好的执行引擎以在严格的开销限制下利用可重用的子专家结构。实验结果表明,PCoMoE在提高模型准确率10%的同时,实现了高达1.31倍的端到端推理加速。

🔬 方法详解

问题定义:本文旨在解决现有MoE推理方法中粗粒度专家选择导致的计算冗余和效率低下问题。现有方法将专家视为原子执行单元,限制了优化的灵活性。

核心思路:PCoMoE的核心思路是将MoE推理从粗粒度的专家选择转变为细粒度的路径组合,通过路径级别的计算和修剪策略来优化计算过程,减少冗余。

技术框架:PCoMoE的整体架构包括路径级专家计算公式、兼容性感知的层级修剪策略和硬件友好的执行引擎。路径级公式允许对专家计算进行更细致的管理,而修剪策略则有助于抑制低价值路径组合。

关键创新:PCoMoE的主要创新在于引入了路径组合的执行框架,打破了传统的整体专家选择限制,使得模型在推理时能够更灵活地利用计算资源。

关键设计:在设计中,PCoMoE采用了兼容性感知的层级修剪策略,确保在执行过程中能够有效抑制低价值路径,同时保持硬件友好的特性,以适应实际应用中的资源限制。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果表明,PCoMoE在推理速度上实现了高达1.31倍的提升,同时模型的准确率提高了10%。这些结果相较于现有基线方法显示了显著的性能优势,验证了该方法的有效性。

🎯 应用场景

该研究的潜在应用领域包括自然语言处理、机器翻译和对话系统等大规模语言模型的推理任务。通过提高推理效率和模型准确率,PCoMoE能够在实际应用中显著提升用户体验和系统性能,具有广泛的实际价值和未来影响。

📄 摘要(原文)

Mixture-of-Experts (MoE) architectures scale Large Language Model (LLM) capacity efficiently by activating a sparse subset of experts per token. However, modern MoE inference remains heavily constrained by the rigid, whole-expert abstraction. Existing frameworks manage, schedule, or prune experts as atomic execution units, which fixes the optimization boundary too early and leaves fine-grained intra-expert computational redundancy underexplored. In this work, we present PCoMoE, a path-compositional execution framework that shifts MoE inference from coarse-grained expert selection to fine-grained path composition. PCoMoE incorporates a path-level formulation of expert computation, a compatibility-aware layer-wise pruning strategy to suppress low-value path combinations, and a hardware-friendly execution engine to exploit reusable sub-expert structures under strictly bounded overheads. Experimental results demonstrate that PCoMoE achieves up to a 1.31x end-to-end inference speedup while enhancing model accuracy by 10%. The code is available at https://github.com/gzyyy0/PCoMoE