mzCache: On-Device LLM Memory Management under Multitasking

📄 arXiv: 2609.01338v1 📥 PDF

作者: Hongseung Yu, Minsung Kim, Jongseok Park, Kyunghan Lee

分类: cs.OS, cs.DC, cs.LG

发布日期: 2026-09-01

备注: MobiCom 2026

DOI: 10.1145/3795866.3844495


💡 一句话要点

提出mzCache以解决移动设备多任务环境下的LLM内存管理问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大型语言模型 内存管理 多任务处理 移动设备 推理优化 并发恢复 低延迟

📋 核心要点

  1. 现有的移动设备LLM推理在多任务环境中面临内存压力,导致内存被驱逐和响应延迟。
  2. mzCache通过灵活的内存管理和并发恢复机制,优化了LLM内存的使用,提升了推理效率。
  3. 实验结果表明,mzCache在首次令牌时间上相比于传统方法实现了显著提升,证明了其在多任务场景中的有效性。

📝 摘要(中文)

移动设备上的大型语言模型(LLM)推理受到广泛关注。然而,移动设备在高度动态的多任务环境中运行,用户频繁切换应用程序,导致内存压力增大,操作系统不得不驱逐LLM内存。当新的推理请求到达时,推理系统必须通过慢速存储读取恢复被驱逐的内存,或重新计算整个KV缓存,严重降低响应速度。为了解决这一问题,本文提出了mzCache,一个针对多任务环境的设备内LLM推理系统,能够在不可预测的内存压力下灵活驱逐LLM内存,并利用移动SoC的统一内存实现零等待推理,同时进行CPU端的并发恢复。mzCache通过恢复导向的内存管理实现这一目标,将LLM内存划分为细粒度共享缓冲区,以支持部分驱逐和恢复,并通过混合交换和向后驱逐策略确保从任何驱逐状态的低延迟恢复。该系统在llama.cpp上实现,并作为Android应用程序部署,相较于基于存储的部分卸载,mzCache在首次令牌时间上实现了2.1-5.5倍的减少,并在真实的多任务场景中展示了其有效性。

🔬 方法详解

问题定义:本文旨在解决移动设备在多任务环境下,LLM内存管理不当导致的内存驱逐和推理延迟问题。现有方法在内存压力下无法有效恢复被驱逐的内存,影响用户体验。

核心思路:mzCache的核心思路是通过恢复导向的内存管理,灵活地驱逐和恢复LLM内存,利用移动SoC的统一内存实现零等待推理。该设计允许在内存不足时进行部分驱逐,并支持并发恢复。

技术框架:mzCache的整体架构包括内存管理模块、恢复机制和推理引擎。内存管理模块负责监控内存使用情况并决定何时驱逐内存,恢复机制则在后台进行内存恢复,推理引擎负责执行LLM推理任务。

关键创新:mzCache的主要创新在于其细粒度共享缓冲区设计,使得LLM内存可以部分驱逐和恢复,同时采用混合交换和向后驱逐策略,确保低延迟恢复。这与现有方法的全量恢复策略形成鲜明对比。

关键设计:mzCache在实现过程中,采用了细粒度的内存划分策略,设置了动态调整的驱逐和恢复策略,并优化了CPU与GPU之间的内存访问,以降低延迟并提高并发性能。具体的参数设置和损失函数设计在论文中有详细描述。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,mzCache在首次令牌时间上实现了2.1-5.5倍的减少,相较于基于存储的部分卸载方法,显著提升了推理效率。此外,mzCache在真实的多任务场景中表现出色,验证了其在实际应用中的有效性。

🎯 应用场景

该研究的潜在应用领域包括移动设备上的智能助手、实时翻译和聊天机器人等场景。通过提升LLM在多任务环境下的响应速度,mzCache能够显著改善用户体验,推动移动AI应用的发展。未来,该技术还可能扩展到其他需要高效内存管理的边缘计算场景。

📄 摘要(原文)

On-device mobile Large Language Model (LLM) inference is gaining significant attention. However, mobile devices operate in highly dynamic multitasking environments where users frequently switch between applications. This creates memory pressure, forcing LLM memory (model weights and KV cache) to be evicted by the operating system. When a new inference request arrives, the inference system must restore the evicted memory through slow storage reads or recompute the entire KV cache, severely degrading responsiveness. To address this, we present mzCache, an on-device LLM inference system with specialized memory management for multitasking environments. Under unpredictable memory pressure, mzCache elastically evicts LLM memory and leverages the unified memory of mobile SoCs to enable zero-wait inference on the GPU with concurrent CPU-side restoration. mzCache realizes this through restoration-oriented memory management: LLM memory is partitioned into fine-grained shared buffers to enable partial eviction and restoration with concurrent cross-processor access, while hybrid swap and backward-out eviction policies ensure low-latency restoration from any eviction state. Implemented on llama.cpp and deployed as an Android application, mzCache achieves 2.1-5.5$\times$ reduction in Time-to-First-Token compared to storage-backed partial offload and demonstrates its effectiveness in real multitasking scenarios.