MACRO: Markov Chain Routing of Transformer Layers
作者: Paweł Batorski, Abtin Pourhadi, Akylgali Aitaza, Przemysław Spurek, Paul Swoboda
分类: cs.CL, cs.AI
发布日期: 2026-08-06
🔗 代码/项目: GITHUB
💡 一句话要点
提出MACRO以优化Transformer层的动态路由问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 动态层路由 马尔可夫链 Transformer 大型语言模型 推理优化 计算效率 深度学习
📋 核心要点
- 现有的动态层路由方法通常需要修改模型权重或在推理时依赖真实标签,限制了其应用灵活性。
- MACRO通过马尔可夫策略实现层的动态路由,允许在不修改模型参数的情况下进行任务特定的优化。
- 实验结果表明,MACRO在多个基准测试中平均提高了5.0%的准确率,并且在小模型上获得了最大的性能提升。
📝 摘要(中文)
标准的大型语言模型(LLMs)通常按顺序执行层。动态层路由,即通过层的不同执行路径进行搜索,包括层的重复、跳过等操作,可以提升性能。现有的路由方法往往需要更新模型权重、在每个测试实例上运行昂贵的搜索循环,或在推理过程中需要真实标签。本文提出了Markov Chain Routing of Transformer Layers(MACRO),一个在不修改底层参数的情况下学习任务特定路由的框架。MACRO将层路由建模为依赖上下文的马尔可夫策略,支持跳过、重复和残差隐藏状态添加操作。通过训练数据反馈更新马尔可夫路由分布,并使用top-k Viterbi算法解码以隔离高概率候选程序。我们在多个开放权重LLMs上评估MACRO,结果显示其在推理和知识基准上平均提高了5.0%的准确率,尤其在小模型上表现最佳。
🔬 方法详解
问题定义:现有的动态层路由方法在推理时需要更新模型权重或依赖真实标签,导致灵活性不足和计算成本高。
核心思路:MACRO通过马尔可夫链建模层路由,利用上下文信息动态选择执行路径,从而在不修改模型参数的情况下提高性能。
技术框架:MACRO框架包括层索引、计算预算阶段、方向位移和操作上下文等模块,支持跳过、重复和残差状态添加操作。马尔可夫路由分布通过训练数据反馈进行更新,并使用top-k Viterbi算法进行解码。
关键创新:MACRO的主要创新在于其不需要修改模型参数即可实现动态层路由,显著降低了计算成本并提高了推理效率。
关键设计:在设计中,MACRO使用了上下文依赖的马尔可夫策略,并通过反馈机制不断优化路由选择,确保高概率候选程序的有效性。具体的参数设置和损失函数设计在实验中进行了详细验证。
🖼️ 关键图片
📊 实验亮点
在多个开放权重LLMs的评估中,MACRO实现了平均5.0%的准确率提升,尤其在小模型上表现出色。此外,MACRO在性能上超越了最佳动态路由方法Dr. LLM,提升幅度达到7.2%,并将路由搜索时间缩短至原来的9.4倍。
🎯 应用场景
MACRO的研究成果可广泛应用于自然语言处理、机器翻译和对话系统等领域,尤其是在需要高效推理和动态调整模型结构的场景中。其灵活的路由机制将为未来的模型设计提供新的思路,推动智能系统的进一步发展。
📄 摘要(原文)
Standard Large Language Models (LLMs) execute layers sequentially. Dynamic layer routing, i.e. search for a different execution path through layers involving layer repetitions, skips and other moves, can improve performance. Existing routing approaches often require updating model weights, running expensive search loops per test instance, or demand ground-truth labels during inference. In this work, we propose Markov Chain Routing of Transformer Layers (MACRO), a framework that learns task-specific routes over LLM architectures without modifying underlying parameters. MACRO models layer routing as a context-dependent Markov policy conditioned on layer indices, computation budget phases, directional displacements, and operator context, supporting skip, repeat, and residual hidden-state addition operations. The Markov route distribution is updated via feedback on training data and decoded using a top-k Viterbi algorithm to isolate high-probability candidate programs. We evaluate MACRO across diverse reasoning and knowledge benchmarks on multiple open-weight LLMs. MACRO achieves a +5.0% average accuracy improvement over the unrouted baselines, with largest gains on small models. We outperform the best dynamic routing approach Dr. LLM by +7.2%, while reducing route-search time 9.4x (from 14.8 to 1.6 hours). Our code is publicly available at https://github.com/Batorskq/MACRO.