Multi-Level Modeling of Large Language Model Inference Latency and Energy via Hybrid Analytical--Machine-Learning Predictors

📄 arXiv: 2608.06723v1 📥 PDF

作者: Saeid Shokoufa, Mohammad Erfan Sadeghi, Mehdi Kamal, Massoud Pedram

分类: cs.LG, cs.AI

发布日期: 2026-08-07


💡 一句话要点

提出HYMELL框架以解决LLM推理延迟与能耗问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大型语言模型 推理延迟 能耗估计 混合建模 机器学习 系统优化 硬件设计 NVIDIA H100

📋 核心要点

  1. 现有方法在估计大型语言模型的推理延迟和能耗时存在准确性不足的问题,影响可持续人工智能的部署。
  2. 论文提出HYMELL框架,通过三层次混合建模,结合分析与机器学习,来提高推理延迟和能耗的估计精度。
  3. 在NVIDIA H100 GPU上评估时,HYMELL对LLaMA 3 8B的推理延迟和能耗预测误差均低于5%,显示出良好的性能。

📝 摘要(中文)

随着大型语言模型(LLMs)的快速扩展,计算成本、能耗和推理延迟显著增加,因此准确估计变得至关重要。本研究提出了HYMELL框架,通过结合分析建模与机器学习,建立了一个三层次的混合模型来估计LLM的推理延迟和能耗。HYMELL通过对原始操作的分析估计、高层组件的机器学习预测以及捕捉系统级开销的端到端模型,支持多种架构。实验结果表明,HYMELL在NVIDIA H100 GPU上对LLaMA 3 8B的预测误差低于5%。

🔬 方法详解

问题定义:本论文旨在解决大型语言模型推理过程中的延迟和能耗估计问题。现有方法往往无法提供足够的准确性,导致在硬件设计和资源分配上的低效。

核心思路:HYMELL框架通过将分析建模与机器学习结合,采用三层次的模型结构,分别处理原始操作、高层组件和系统级开销,从而实现高效的推理延迟和能耗预测。

技术框架:HYMELL的整体架构包括三个主要层次:第一层为原始操作的分析估计,第二层为高层组件的机器学习预测,第三层为端到端模型,捕捉预填充和解码阶段的系统级开销。

关键创新:HYMELL的创新在于其混合建模方法,能够直接从架构参数预测执行成本,显著提高了设计空间探索的速度和能效优化的能力。

关键设计:在设计中,HYMELL采用了针对不同网络架构(如密集网络和专家混合网络)的适应性模型,确保了对多种注意力机制(如多头注意力和分组查询注意力)的支持。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

HYMELL框架在NVIDIA H100 GPU上对LLaMA 3 8B的推理延迟和能耗预测误差均低于5%,显示出其高预测准确性。该框架的设计使得在无硬件依赖的情况下,快速进行设计空间探索和能效优化成为可能。

🎯 应用场景

该研究的潜在应用领域包括大型语言模型的高效部署、硬件设计优化和能耗管理。HYMELL框架能够帮助研究人员和工程师在设计阶段快速评估不同架构的性能,为可持续人工智能的发展提供支持。

📄 摘要(原文)

The rapid scaling of Large Language Models (LLMs) has significantly increased computational cost, energy consumption, and inference latency, making accurate estimation essential for sustainable artificial intelligence deployment and hardware-aware design. In this work, we introduce Hybrid Modeling for Energy and Latency of LLMs (HYMELL), a hybrid three-level framework for estimating LLM inference latency and energy by combining analytical modeling with machine learning (ML). HYMELL models LLM execution through a three-level hierarchy: analytical estimation of primitive operations, ML prediction of higher-level components, and an end-to-end model that captures system-level overheads across both prefill and decode phases. The framework supports diverse architectures, including dense and mixture-of-experts (MoE) feed-forward networks (FFNs), as well as multi-head attention (MHA) and grouped-query attention (GQA) mechanisms. Evaluated on an NVIDIA H100 graphics processing unit (GPU), HYMELL achieves high predictive accuracy; notably, for LLaMA 3 8B, it attains less than 5% error for both prefill and decode phases. By predicting execution costs directly from architectural parameters, it enables fast, hardware-free design space exploration and energy-efficient optimization.