The Retriever Should Remember: Experience-Amortized Reranking for Long-Term Agent Memory

📄 arXiv: 2608.22767v1 📥 PDF

作者: Qi Feng, Chris Ding, Jicong Fan

分类: cs.AI

发布日期: 2026-08-24


💡 一句话要点

提出EARM框架以解决长期代理记忆中的检索效率问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 长期记忆 检索效率 语言模型 重排序 因果矩阵补全 智能代理 信息检索

📋 核心要点

  1. 现有的检索方法未能有效利用长期代理的记忆经验,导致检索效率低下。
  2. 论文提出EARM框架,通过重用历史LLM相关性评分来提升检索效率,减少每次查询的计算开销。
  3. 实验结果显示,EARM在仅17.5%的候选项获得直接LLM评分的情况下,仍能提高回答准确性,显著降低推理开销。

📝 摘要(中文)

长期语言模型代理在交互中积累记忆,但其检索器通常不积累检索经验。语义检索虽然高效,但嵌入相似性并不总能反映记忆是否与当前查询相关。大型语言模型(LLM)重排序器提供更强的查询条件相关性评分,但无状态重排序在每次查询后丢弃评分。本文提出EARM框架,将先前获得的LLM相关性评分视为可重用的检索经验,通过在线矩阵存储稀疏的查询-记忆相关性评分,并通过因果矩阵补全学习其共享结构,结合少量新观察到的评分与估计评分重新排序剩余候选项。实验表明,混合观察和估计的重排序在回答准确性上比语义检索提高了6.62%。

🔬 方法详解

问题定义:本文旨在解决长期语言模型代理在检索过程中未能有效利用历史检索经验的问题。现有方法在每次查询中重复评分,导致计算资源浪费。

核心思路:EARM框架的核心思想是将历史LLM相关性评分视为可重用的检索经验,通过在线矩阵存储和因果矩阵补全来学习和利用这些评分。

技术框架:EARM的整体架构包括三个主要模块:在线矩阵存储稀疏的查询-记忆相关性评分、因果矩阵补全以学习共享结构、以及结合新观察评分与估计评分进行重排序的过程。

关键创新:EARM的创新在于将历史评分转化为可重用的检索经验,改变了LLM重排序的状态,使其成为一种长期学习的能力,而非一次性计算。

关键设计:在设计中,EARM使用稀疏矩阵存储相关性评分,采用因果矩阵补全技术来学习评分之间的关系,并通过混合新旧评分来优化重排序过程。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

实验结果表明,EARM框架在回答准确性上比传统语义检索提高了6.62%。在仅17.5%的候选项获得直接LLM评分的情况下,EARM仍能保持高效的重排序能力,显著降低推理开销,展示了其在长期记忆检索中的优势。

🎯 应用场景

该研究的潜在应用领域包括智能助手、对话系统和信息检索等场景。通过提升长期记忆的检索效率,EARM框架能够显著改善用户体验,降低计算资源消耗,推动智能代理的实用化和智能化发展。

📄 摘要(原文)

Long-term language-model agents accumulate memories across interactions, but their retrievers typically do not accumulate retrieval experience. Semantic retrieval is efficient, but embedding similarity does not always reflect whether a memory contains evidence relevant to the current query. Large language model (LLM) rerankers provide stronger query-conditioned relevance scores, yet stateless reranking repeatedly scores a large candidate pool and discards these scores after each query. We introduce EARM, an experience-amortized reranking framework that treats previously acquired LLM relevance scores as reusable retrieval experience. EARM stores sparse query--memory relevance scores in an online matrix, learns their shared structure through causal matrix completion, and combines a small set of newly observed scores with estimated scores to rerank the remaining candidates. The scoring budget decreases as experience accumulates, changing LLM reranking from a repeated per-query expense into a retrieval capability learned over an agent's lifetime. Experiments on long-term conversational memory show that mixed observed-and-estimated reranking improves answer accuracy over semantic retrieval by up to 6.62% and remains effective when only 17.5% of candidates receive direct LLM relevance scores, thereby substantially reducing the inference overhead of LLM reranking. These results motivate a broader view of agent memory: a long-lived agent should remember not only past content, but also how that content has proved useful for retrieval.