When Users Don't Ask: Benchmarking Context-Driven Memory Retrieval in Conversational Agents

📄 arXiv: 2609.03467v1 📥 PDF

作者: Wen-Yu Chang, Yun-Nung Chen

分类: cs.CL, cs.AI

发布日期: 2026-09-03


💡 一句话要点

提出LOCOMO-CONV基准以解决对话代理中的记忆检索问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 对话系统 记忆检索 大型语言模型 隐式查询 组合查询 推理基础 用户体验

📋 核心要点

  1. 现有的记忆系统基准主要通过问答方式评估,未能反映实际对话中的记忆使用情况。
  2. 本文提出LOCOMO-CONV基准,采用对话、隐式、反事实和组合四种查询风格,评估记忆检索和响应质量。
  3. 实验结果显示,隐式和组合查询的检索差距显著,且强检索未必提升响应质量,提示推理基础的记忆详细化的潜力。

📝 摘要(中文)

大型语言模型(LLMs)越来越多地被用作长时间对话代理,这引发了对记忆系统的关注。然而,现有基准主要通过问答式探测来评估记忆,而非在实际对话中的使用。本文提出了LOCOMO-CONV,这是一个基于Lo-CoMo的对话记忆基准,包含四种查询风格:对话、隐式、反事实和组合。通过对五种代表性记忆系统的评估,我们发现对话框架揭示了问答基准未能发现的显著检索差距,尤其是在隐式和组合查询中。我们的实验结果表明,强检索并不完全转化为响应质量,隐式查询表现出静默基础,即记忆改善了上下文基础而未明确呈现黄金事实。这些结果指向基于推理的记忆详细化作为一个有前景的方向。

🔬 方法详解

问题定义:本文旨在解决现有记忆系统基准在实际对话中评估不足的问题,现有方法主要依赖问答式探测,无法全面反映记忆的实际使用效果。

核心思路:LOCOMO-CONV基准通过引入多种查询风格,特别是隐式和组合查询,来更全面地评估记忆系统在对话中的表现,旨在揭示传统基准未能捕捉的检索差距。

技术框架:该方法包括四个主要模块:对话查询、隐式查询、反事实查询和组合查询,结合五种代表性记忆系统进行评估,重点关注检索回忆率和端到端响应质量。

关键创新:最重要的创新在于通过对话框架揭示了隐式和组合查询的检索差距,强调了记忆系统在实际对话中的重要性,尤其是在上下文基础的改善方面。

关键设计:在实验中,采用了多种查询风格的重写策略,针对原始记忆和抽象记忆的表现进行了比较,特别关注隐式查询的静默基础现象。实验还引入了辅助的支持记忆注释,以捕捉对话中有用的上下文信息。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

实验结果表明,LOCOMO-CONV基准在隐式和组合查询中揭示了显著的检索差距,尤其是多面查询重写策略在原始记忆中的表现提升。强检索未必直接提升响应质量,隐式查询的静默基础现象为未来研究提供了新方向。

🎯 应用场景

该研究的潜在应用领域包括智能对话系统、客户服务机器人和个性化助手等。通过改进记忆检索机制,能够提升对话代理的响应质量和用户体验,未来可能在人机交互中发挥更大作用。

📄 摘要(原文)

Large language models (LLMs) are increas- ingly deployed as long-horizon conversational agents, motivating growing interest in mem- ory systems. However, existing benchmarks primarily evaluate memory through QA-style probing rather than in-situ conversational usage. We introduce LOCOMO-CONV, a conversa- tional memory benchmark derived from Lo- CoMo with four query styles: dialog, implicit, counterfactual, and composed. Across five rep- resentative memory systems, we evaluate both retrieval recall and end-to-end response qual- ity. Our experiments show that conversational framing exposes substantial retrieval gaps over- looked by QA benchmarks, especially on im- plicit and composed queries, which multi-facet query rewriting narrows for raw-turn mem- ory but not abstractive memory. We further find that strong retrieval does not fully trans- late into response quality, and that implicit queries exhibit silent grounding, where mem- ory improves contextual grounding without ex- plicitly surfacing the gold fact. These results point to reasoning-based memory elaboration as a promising direction, and we release aux- iliary supportive_memory annotations captur- ing conversationally useful context beyond the original gold evidence.