When Errors Become Memories: Causal Pathway Tracing in Multi-Turn Memory-Augmented LLMs

📄 arXiv: 2608.30198v1 📥 PDF

作者: Shuyao Xiao, Shengling Wang, Xuan Chen, Ke Chao, Ming Cui, Feifei Qian, Fanlin Meng, Chaoyang Mei, Chaoyong Jiang, Qi Ouyang, Junxi Yi

分类: cs.CL

发布日期: 2026-08-31


💡 一句话要点

提出基于结构因果模型的框架以解决记忆增强LLM中的错误传播问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 长时记忆 错误传播 结构因果模型 大型语言模型 动态因果分析 记忆更新 自然语言处理

📋 核心要点

  1. 现有方法主要关注记忆系统的信息存储与检索,缺乏对错误传播机制的深入分析,导致错误风险持续存在。
  2. 本文提出基于结构因果模型的框架,动态建模用户问题、模型响应和记忆状态,识别错误传播的关键路径。
  3. 实验结果显示,错误影响随着交互距离衰减,记忆更新路径的持久性影响显著高于问题反馈,且联合修复方法有效降低残余错误。

📝 摘要(中文)

长时记忆使大型语言模型(LLMs)能够在交互中保留和重用信息,但也可能将局部错误转化为持久风险。现有研究主要评估记忆系统是否正确存储和检索信息,缺乏对错误如何在响应、记忆状态和未来交互中传播的深入理解。本文提出了一种基于结构因果模型(SCM)的框架,用于分析记忆增强LLMs中的跨轮次错误传播。我们将用户问题、模型响应和记忆状态建模为动态因果过程,并识别出内部记忆更新和外部问题反馈两个入口路径。通过对这些路径的干预,我们构建了四条反事实轨迹,并量化其下游影响和相互作用。实验表明,错误影响通常随着交互距离的增加而衰减,而记忆更新路径比问题反馈产生更持久的影响;潜在错误可能在自然响应消失后仍然存在。

🔬 方法详解

问题定义:本文旨在解决记忆增强LLMs中错误传播的问题,现有方法未能充分理解错误如何在交互中持续存在及其影响。

核心思路:通过构建基于结构因果模型的框架,动态分析用户问题、模型响应和记忆状态之间的因果关系,识别并干预错误传播路径。

技术框架:整体架构包括用户输入、模型输出和记忆状态三个主要模块,采用动态因果模型分析其交互影响,并通过干预构建反事实轨迹。

关键创新:提出了内部记忆更新和外部问题反馈两个错误传播路径的概念,显著提升了对错误影响的理解和干预能力。

关键设计:在实验中设置了四条反事实轨迹,评估错误影响的四个层面,包括记忆保留、自然响应、针对性诊断探测和概率级错误偏好。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

实验结果表明,采用路径引导的修复方法,问题修复减少残余错误27.5%,记忆修复减少70.2%,联合修复几乎消除了残余传播,提升效果显著,验证了提出方法的有效性。

🎯 应用场景

该研究为大型语言模型在实际应用中的错误管理提供了新的思路,特别是在需要长期记忆的对话系统、智能客服和教育领域。通过有效识别和修复错误传播路径,可以显著提升模型的可靠性和用户体验。

📄 摘要(原文)

Long-term memory enables large language models (LLMs) to preserve and reuse information across interactions, but it can also turn localized errors into persistent risks. Existing work mainly evaluates whether memory systems store and retrieve information correctly, leaving limited understanding of how errors propagate across responses, memory states, and future interactions. We propose a structural causal model (SCM)-based framework for cross-turn error propagation in memory-augmented LLMs. We model user questions, model responses, and memory states as a dynamic causal process, and identify two entry pathways: internal memory updating and external question feedback. By intervening on these pathways, we construct four counterfactual trajectories and quantify their downstream effects and interaction. Error influence is evaluated at four levels: memory retention, natural responses, targeted diagnostic probing, and probability-level error preference. Experiments show that error influence generally decays with interaction distance, while the memory-update pathway contributes more persistent effects than question feedback; latent errors may remain even after disappearing from natural responses. Propagation patterns also vary across memory categories and memory mechanisms. Pathway-guided restoration further validates this decomposition: Question Repair reduces residual error by 27.5%, Memory Repair by 70.2%, and Joint Repair by 98.3%, nearly eliminating residual propagation.