Mamba with Hierarchical Memory: Solving Representation Bottleneck in Long Sequence Modeling
作者: Qinwen Wang, Jieping Luo, Aoxiang Qin, Ruoyu Zhao, Jianxiong Tang, Wei Zhang, Zhichao Lu, Luziwei Leng
分类: cs.AI
发布日期: 2026-08-03
备注: 19 pages, preprint
💡 一句话要点
提出层次记忆Mamba以解决长序列建模中的表示瓶颈问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 长序列建模 层次记忆 递归线性注意力 段落级语义 跨任务泛化
📋 核心要点
- 现有的递归线性注意力模型在处理长序列时,由于固定容量的递归状态,导致表示能力不足,无法有效捕捉长距离依赖关系。
- 本文提出的层次记忆Mamba(HMM)通过引入轻量级工作记忆,提取段落级语义并压缩为长期记忆,从而解决了表示瓶颈问题。
- 实验结果显示,HMM在多个任务上显著提升了检索成功率和推理准确率,同时保持了较低的参数增加和训练开销。
📝 摘要(中文)
递归线性注意力模型(RLA)如Mamba提供了高效的线性时间序列建模,但其固定容量的递归状态限制了长序列建模。本文提出层次记忆Mamba(HMM),借鉴人类记忆的层次结构,集成轻量级工作记忆,从快速感官记忆中提取慢速段落级语义(PLS),并将其压缩为持久的长期记忆以便于任务相关的检索。HMM通过参数学习克服了RLA的表示瓶颈,并实现跨任务的泛化。实验结果表明,HMM在Passkey Retrieval和LongBench-E任务上相较于强大的Mamba模型,检索成功率提高了34.3%至37.1%,推理准确率提高了1.6%至14.2%,同时仅增加了2%的参数和最小的训练开销。
🔬 方法详解
问题定义:本文旨在解决递归线性注意力模型(RLA)在长序列建模中的表示瓶颈问题。现有方法由于固定容量的递归状态,无法有效处理长距离依赖,限制了模型的性能。
核心思路:提出层次记忆Mamba(HMM),通过引入轻量级的工作记忆,提取段落级语义(PLS),并将其压缩为长期记忆,以便于任务相关的检索,从而克服表示瓶颈。
技术框架:HMM基于预训练的Mamba骨干网络,整体架构包括快速感官记忆和轻量级工作记忆两个主要模块。快速感官记忆负责捕捉快速变化的输入信息,而工作记忆则提取和压缩段落级语义。
关键创新:HMM的核心创新在于其层次化的记忆结构,能够有效整合短期和长期记忆,提升了模型在长序列任务中的表现。这一设计在其他长上下文增强的Mamba变体中并未实现。
关键设计:HMM在参数设置上仅增加了2%的额外参数,且训练开销最小。损失函数和网络结构经过优化,以确保在保持高效性的同时,能够有效提取和利用段落级语义。
🖼️ 关键图片
📊 实验亮点
实验结果表明,HMM在Passkey Retrieval和LongBench-E任务上,检索成功率提高了34.3%至37.1%,推理准确率提高了1.6%至14.2%。这些提升在仅增加2%参数的情况下实现,显示出HMM的高效性和优越性。
🎯 应用场景
该研究的潜在应用领域包括自然语言处理、长序列数据分析和智能问答系统等。通过提升长序列建模的能力,HMM可为多种任务提供更为准确和高效的解决方案,具有重要的实际价值和广泛的应用前景。
📄 摘要(原文)
Recurrent linear attention models (RLAs) such as Mamba offer efficient linear-time sequence modeling as an alternative to Transformers, yet their fixed-capacity recurrent states limit long-sequence modeling. Drawing inspiration from hierarchical human memory, we propose Hierarchical Memory Mamba (HMM) to address this limitation. Building upon a pre-trained Mamba backbone, HMM integrates a lightweight working memory that extracts slow paragraph-level semantics (PLS) from the fast sensory memory embedded in the backbone's hidden states. The PLS is subsequently compressed into persistent long-term memory for task-relevant retrieval. The hierarchical processing of semantic information overcomes the representation bottleneck of RLAs and endows HMM cross-task generalization through parametric learning, which is not observed in other long-context enhanced Mamba variants. Evaluations on Passkey Retrieval and LongBench-E tasks demonstrate that HMM improves retrieval success by 34.3--37.1% and reasoning accuracy by 1.6--14.2% over strong Mamba-based models, while adding only 2% extra parameters and with minimal training overhead.