Goodput Maximization for Large Language Model Edge Inference: A Two-Phase Maskable PPO Approach

📄 arXiv: 2608.25543v1 📥 PDF

作者: Xiaojing Chen, Qi Zhang, Wei Ni, Shunqing Zhang, Yanzan Sun

分类: eess.SY, cs.AI

发布日期: 2026-08-26

DOI: 10.1109/LWC.2026.3718001


💡 一句话要点

提出TP-MPPO算法以优化大语言模型边缘推理的良好吞吐量

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 边缘计算 大语言模型 任务卸载 带宽分配 近端策略优化 无线网络 系统吞吐量

📋 核心要点

  1. 现有方法在大语言模型推理服务中面临任务卸载决策和带宽分配的挑战,难以同时满足高吞吐量和严格的服务水平目标。
  2. 本文提出的TP-MPPO算法通过两阶段优化策略,结合动作掩蔽机制和带宽分配策略,有效提升了系统的良好吞吐量。
  3. 仿真实验结果显示,TP-MPPO在系统奖励上较基准方法提升了33.3%至87.5%,显著提高了推理服务的性能。

📝 摘要(中文)

本文提出了一种新颖的两阶段可掩蔽近端策略优化(TP-MPPO)算法,旨在最大化无线边缘网络中大语言模型推理服务的系统良好吞吐量,同时严格遵守服务水平目标(SLO)。在TP-MPPO的第一阶段,通过采用动作掩蔽机制的MPPO优化任务卸载决策,有效避免无效动作的探索并减少动作空间。在第二阶段,推导出上行带宽分配的封闭形式解,并设计贪婪算法进行下行带宽分配,以为下一轮的MPPO提供即时奖励。这两个阶段交替进行,直至收敛。仿真结果表明,TP-MPPO相比基准方法可提高系统奖励33.3%至87.5%,并实现最高的良好吞吐量。

🔬 方法详解

问题定义:本文旨在解决在无线边缘网络中进行大语言模型推理时,如何优化任务卸载决策和带宽分配的问题。现有方法在这方面的不足主要体现在无法同时实现高请求吞吐量和严格的服务水平目标(SLO)。

核心思路:TP-MPPO算法的核心思路是通过两阶段的优化过程,首先利用动作掩蔽机制减少无效动作的探索,优化任务卸载决策;其次,通过封闭形式解和贪婪算法进行带宽分配,以提高系统的良好吞吐量。

技术框架:TP-MPPO的整体架构分为两个主要阶段:第一阶段为任务卸载决策优化,采用可掩蔽的近端策略优化(MPPO);第二阶段为带宽分配,包含上行和下行带宽的优化。两个阶段交替进行,直至收敛。

关键创新:TP-MPPO的主要创新在于引入了动作掩蔽机制,显著减少了动作空间,从而提高了优化效率。此外,结合封闭形式解和贪婪算法的带宽分配策略也是其重要创新点。

关键设计:在算法设计中,关键参数包括动作掩蔽的策略、带宽分配的贪婪算法设计,以及MPPO的损失函数设置。这些设计确保了算法在优化过程中的有效性和收敛性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,TP-MPPO算法在系统奖励上相比基准方法提升了33.3%至87.5%,实现了最高的良好吞吐量。这一显著提升验证了该算法在优化大语言模型推理服务中的有效性和优越性。

🎯 应用场景

该研究的潜在应用领域包括无线边缘计算、智能手机应用、物联网设备等,能够有效提升大语言模型在边缘环境中的推理性能。随着边缘计算的普及,TP-MPPO算法将为实时推理服务提供更高的吞吐量和更好的用户体验,具有重要的实际价值和未来影响。

📄 摘要(原文)

This paper presents a novel two-phase maskable proximal policy optimization (TP-MPPO) algorithm, which maximizes the system goodput counting request throughput with strict service level objective (SLO) compliance for large language model (LLM) inference services in wireless edge networks. In the first phase of TP-MPPO, we optimize the task offloading decisions by MPPO with action masking mechanism, effectively avoiding exploring invalid actions and reducing the action space. In the second phase, closed-form solutions are derived for uplink bandwidth allocation; a greedy algorithm is designed for downlink bandwidth allocation to provide immediate rewards for the MPPO in the next round. The two stages alternate till convergence. Simulation results demonstrate that TP-MPPO can improve the system reward by 33.3%--87.5% compared to its benchmarks and achieve the highest goodput.