Weighted Memory Tree: Remembering What Matters for Long-Horizon LLM Agents

📄 arXiv: 2608.20631v1 📥 PDF

作者: Quang Dao, Purvi Kathalkar, Kenneth Eaton

分类: cs.AI

发布日期: 2026-08-21

备注: 16 pages, 2 figures


💡 一句话要点

提出加权记忆树以解决长时间跨度LLM代理的记忆问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 长时间跨度任务 记忆管理 大型语言模型 动态保留分数 信息过滤

📋 核心要点

  1. 现有的记忆方法在处理长时间跨度的执行历史时,容易受到过时和无关信息的影响,导致推理质量下降。
  2. 本文提出的加权记忆树(WMT)通过动态保留分数和分层结构,有效管理和更新记忆内容,确保重要信息的保留。
  3. 实验结果表明,WMT在准确率上提高了9.97个百分点,同时减少了32.8%的提示令牌使用,显示出显著的性能提升。

📝 摘要(中文)

大型语言模型(LLM)代理在解决需要规划、工具使用和外部信息访问的多步骤任务方面表现出色。然而,随着执行历史的增长,推理成本增加,且可能受到过时、不相关或误导性信息的影响,从而降低推理质量。现有的记忆方法虽然能够组织或压缩执行历史,但在决定哪些记忆保持活跃方面提供的机制有限。本文提出了一种分层记忆系统——加权记忆树(WMT),它将执行过程组织为任务、子任务和动作,并为每个记忆分配动态保留分数。通过事件驱动的更新和选择性衰减,WMT能够保留有用信息、折叠已完成的轨迹、抑制低效内容,并保持对折叠上下文的访问。我们在GAIA-Text上评估WMT,使用Qwen3-8B、Gemma 4 E4B和Llama-3.1-8B进行实验,结果显示WMT相较于线性记忆提高了9.97个百分点的准确率,同时减少了32.8%的提示令牌使用。记忆污染实验表明,WMT限制了不可靠信息的持久性和传播。

🔬 方法详解

问题定义:本文旨在解决大型语言模型(LLM)代理在长时间跨度任务中,因执行历史增长而导致的推理成本增加和信息过时的问题。现有方法在决定哪些记忆保持活跃方面存在不足,容易影响推理质量。

核心思路:加权记忆树(WMT)通过分层组织执行过程,并为每个记忆分配动态保留分数,提供了一种有效的记忆管理机制。通过事件驱动的更新和选择性衰减,WMT能够保留重要信息并抑制低效内容。

技术框架:WMT的整体架构包括任务、子任务和动作的分层结构。每个记忆都有一个动态保留分数,基于事件更新和选择性衰减来调整。系统能够折叠已完成的轨迹,并保持对折叠上下文的访问。

关键创新:WMT的主要创新在于动态保留分数的引入,使得记忆的管理更加灵活和高效。与现有方法相比,WMT不仅关注信息的存储量,更强调哪些信息应该保持活跃,从而提升推理质量。

关键设计:WMT的设计包括动态保留分数的计算方式、事件驱动的更新机制以及选择性衰减策略。具体的参数设置和损失函数设计尚未详细披露,需进一步研究。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果显示,加权记忆树(WMT)在GAIA-Text上的表现优于线性记忆,准确率提高了9.97个百分点,同时减少了32.8%的提示令牌使用。此外,记忆污染实验表明,WMT有效限制了不可靠信息的持久性和传播,显示出其在信息管理上的优势。

🎯 应用场景

该研究的潜在应用领域包括智能助手、自动化决策系统和复杂任务的执行代理。通过有效管理记忆,LLM代理能够在长时间跨度的任务中保持高效的推理能力,提升用户体验和系统性能。未来,WMT的设计理念可能会影响更多领域的智能系统开发。

📄 摘要(原文)

Large language model (LLM) agents have demonstrated the ability to solve multi-step tasks requiring planning, tool use, and external information access, yet growing execution histories increase inference cost and expose reasoning to outdated, irrelevant, or misleading information, potentially degrading reasoning quality. Existing memory approaches organize or compress execution histories but provide limited mechanisms for deciding which memories remain active. We introduce the, a hierarchical memory system that organizes execution into tasks, subtasks, and actions while assigning each memory a dynamic retention score. Event-based updates and selection-based decay revise these scores, allowing WMT to preserve useful information, fold completed trajectories, suppress low-utility content, and retain access to folded context. We evaluate WMT on GAIA-Text using Qwen3-8B, Gemma 4 E4B, and Llama-3.1-8B, with ablations and memory-poisoning experiments. Relative to linear memory, WMT improves accuracy by an average of 9.97 percentage points while reducing prompt-token usage by 32.8%. Memory-poisoning experiments show that WMT limits the persistence and propagation of unreliable information. Our results suggest that effective long-horizon agent memory depends less on storing more information than on deciding which information should remain active.