GraphMemix: Query-Aware Evidence Forests for Long-Term Multimodal Agent Memory

📄 arXiv: 2608.26983v1 📥 PDF

作者: Geng Li, Yuhao Wang, Dong Li, Jianye Hao, Yuxin Peng

分类: cs.AI

发布日期: 2026-08-27

备注: Project page with code: https://github.com/ligeng0197/graphmemix


💡 一句话要点

提出GraphMemix以解决多模态代理长期记忆组织问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 长时间记忆 多模态代理 图记忆 证据森林 查询优化 信息组织 机器学习

📋 核心要点

  1. 现有的长期记忆组织方法存在昂贵的无关问题摘要和简单相似性匹配的不足,导致信息冗余和不完整。
  2. GraphMemix通过构建基于查询的证据森林,采用候选图构建、证据效用解耦和森林优化等策略,有效组织记忆。
  3. 在四个长期多模态记忆基准上,GraphMemix显著提升了性能,建立了准确性与生命周期成本之间的新Pareto前沿。

📝 摘要(中文)

组织多模态代理的长期记忆仍然面临挑战,现有方法往往依赖于昂贵的无关问题离线摘要或简单的嵌入相似性匹配,导致上下文不完整和冗余。为了解决这些问题,本文提出了GraphMemix,一个组合优化图记忆框架,将记忆组织建模为基于查询的证据森林构建。该方法包括候选图构建、证据效用与激活成本解耦以及森林优化三个关键组件。通过将记忆组织成与查询相关的子图,GraphMemix避免了高生命周期成本,并恢复了低相似度的互补证据。实验结果表明,该方法在四个长期多模态记忆基准上显著提升了性能,并在准确性与生命周期成本之间建立了新的Pareto前沿。

🔬 方法详解

问题定义:本文旨在解决多模态代理的长期记忆组织问题,现有方法在处理查询时往往依赖昂贵的无关问题摘要或简单的相似性匹配,导致信息冗余和上下文不完整。

核心思路:GraphMemix的核心思路是将记忆组织视为基于查询的证据森林构建,通过候选图构建和证据效用解耦来优化记忆的组织和检索效率。

技术框架:该方法的整体架构包括三个主要模块:候选图构建、证据效用与激活成本解耦、以及森林优化。候选图构建通过多视角种子记忆扩展获取查询相关的上下文,证据效用解耦则抑制冗余信息,最后通过森林优化选择最优的记忆上下文。

关键创新:GraphMemix的创新在于其将记忆组织建模为查询相关的子图,避免了高生命周期成本,并有效恢复低相似度的互补证据。这一方法与传统的记忆组织方法在处理信息的方式上有本质区别。

关键设计:在设计上,GraphMemix采用了候选图构建的多视角种子记忆扩展策略,证据效用和激活成本的解耦设计,以及在最大证据预算下的森林优化选择,确保了信息的高效利用和组织。具体的参数设置和损失函数设计在实验中进行了详细验证。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在四个长期多模态记忆基准上,GraphMemix显著提升了性能,具体表现为在不同基础模型下的准确性和生命周期成本之间建立了新的Pareto前沿,展示了其在效率和效果上的优越性。

🎯 应用场景

GraphMemix的研究成果在多模态智能代理、机器人记忆管理和人机交互等领域具有广泛的应用潜力。通过优化长期记忆的组织方式,该方法可以提升智能系统在复杂环境中的决策能力和响应效率,具有重要的实际价值和未来影响。

📄 摘要(原文)

Organizing long-term memory for multimodal agents remains challenging because existing methods either suffer from expensive question-agnostic offline summaries or naive embedding similarity matching that introduces incomplete and redundant context. To address these issues, we propose GraphMemix, a combinatorial-optimization graph memory framework that models memory organization as query-aware evidence-forest construction. Specifically, our method consists of three key components:(1) candidate graph construction, which expands multi-view seed memories through schema and semantic relations to acquire query-aware original context; (2) evidence utility and activation costs, which decouples direct memory support from anchor-conditioned relation verification to suppress redundant or conflicting information; and (3) forest optimization, which jointly selects a forest-format memory context under a maximum evidence budget and its reliable relational structure. By organizing memory into a query-relevant subgraph, the method avoids substantial lifecycle cost and recovers low-similarity complementary evidence. Experimental results across four long-term multimodal memory benchmarks demonstrate significant improvements with different foundation models and establish a new Pareto frontier between accuracy and lifecycle cost.