MemTxn: A Transaction Boundary for Source-Supported Updates and Complete-State Recovery in Agent Memory
作者: Hanshuai Cui, Zhiqing Tang, Zhi Yao, Fanshuai Meng, Qianli Ma, Weijia Jia
分类: cs.AI, cs.CL
发布日期: 2026-07-30
💡 一句话要点
提出MemTxn以解决持久内存更新和状态恢复问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 持久内存 事务边界 状态恢复 智能代理 信息更新 大规模语言模型 内存管理
📋 核心要点
- 现有系统在持久内存中无法提供可靠的更新和状态恢复事务边界,导致错误可能持续并影响未来行为。
- 本文提出MemTxn,通过验证更新来源和选择可见版本来确保内存更新的可靠性,并在故障后恢复状态。
- 实验结果表明,MemTxn在多个基准测试中表现优异,尤其在MemoryAgentBench上F1得分显著高于Dense模型。
📝 摘要(中文)
持久内存使得长时间运行的大型语言模型代理能够在会话和任务之间重用信息。然而,可写内存中的错误可能会持续存在并破坏未来的行为。现有系统虽然改善了存储和检索,但未能提供可靠更新和恢复的事务边界。为此,本文提出了MemTxn,一个位于答案模型之外的治理层。MemTxn验证更新是否得到其来源的支持,并在事实冲突时选择可见版本,故障后恢复应用可见状态。该系统使用Ordered PatchTest验证写入,Temporal Resolver选择版本,并通过持久快照日志恢复状态。在一项项目不重叠的审计中,MemTxn接受了所有60个支持的原件,并拒绝了所有179个硬负样本。在LongMemEval-S和LoCoMo状态下的持久多键故障下,MemTxn在不知道实际物理写入集的情况下恢复了完整的声明活动映射。在MemoryAgentBench FactConsolidation上,MemTxn在所有十二个答案模型配置中实现了最高的平均F1,超越Dense 17.06至24.07分。
🔬 方法详解
问题定义:本文旨在解决持久内存中更新和状态恢复的事务边界问题。现有方法无法有效处理可写内存中的错误,导致未来行为受到影响。
核心思路:MemTxn通过引入一个治理层来验证更新的来源,并在冲突时选择可见版本,从而确保内存更新的可靠性和状态恢复的完整性。
技术框架:MemTxn的整体架构包括三个主要模块:Ordered PatchTest用于验证写入,Temporal Resolver用于选择版本,以及持久快照日志用于状态恢复。这些模块协同工作,确保系统在故障发生时能够恢复到一致状态。
关键创新:MemTxn的核心创新在于引入了事务边界的概念,能够在不依赖实际物理写入集的情况下恢复完整的活动映射。这一设计与现有方法的根本区别在于其提供了更高的可靠性和一致性。
关键设计:MemTxn采用了特定的参数设置和验证机制,以确保写入的有效性和一致性。具体的损失函数和网络结构细节在论文中有详细描述,确保系统在多种情况下都能保持高效性能。
🖼️ 关键图片
📊 实验亮点
在实验中,MemTxn在LongMemEval-S和LoCoMo状态下成功恢复了完整的活动映射,且在MemoryAgentBench FactConsolidation上实现了最高的平均F1得分,超越Dense模型17.06至24.07分,显示出其在处理持久内存更新和状态恢复方面的显著优势。
🎯 应用场景
MemTxn的研究成果在多个领域具有潜在应用价值,尤其是在需要长时间运行和高可靠性的智能代理系统中。其能够有效管理持久内存中的信息更新和状态恢复,适用于大规模语言模型、智能助手和其他需要持续学习和适应的人工智能系统。未来,MemTxn可能会推动更高效的内存管理技术的发展,提升智能系统的可靠性和用户体验。
📄 摘要(原文)
Persistent memory lets long-running large language model agents reuse information across sessions and tasks. Yet errors in writable memory can persist and corrupt future behavior. Existing systems improve storage and retrieval, but they do not provide a transaction boundary for reliable updates and recovery. We therefore propose MemTxn, a governance layer outside the answer model. MemTxn verifies whether an update is supported by its source. It also selects the visible version when facts conflict and restores the application-visible state after a fault. The system uses Ordered PatchTest to validate writes, a Temporal Resolver to select versions, and a durable snapshot journal to recover state. On an item-disjoint audit, MemTxn accepts all 60 supported originals and rejects all 179 hard negatives. Under persistent multi-key faults on LongMemEval-S and LoCoMo states, it restores the complete declared active map without knowing the actual physical write set. On MemoryAgentBench FactConsolidation, MemTxn achieves the highest average F1 across all twelve answer-model configurations. It outperforms Dense by 17.06--24.07 points in five representative settings.