RRM: Experience-Driven Reflective Retrieval Memory for Long-Horizon Multimodal Reasoning

📄 arXiv: 2607.28156v1 📥 PDF

作者: Jingxiang Fan, Junbao Zhuo, Bochao Zou

分类: cs.CL

发布日期: 2026-07-30


💡 一句话要点

提出反思性检索记忆框架以解决长视频多模态推理问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 长视频理解 反思性记忆 多模态推理 检索机制 经验记忆

📋 核心要点

  1. 现有的多模态长期记忆代理在检索存储记忆时存在准确性不足和适应性差的问题。
  2. 提出的反思性检索记忆(RRM)框架通过引入反思性经验记忆来优化检索策略,提升多模态推理能力。
  3. RRM在多个基准测试中表现优异,超越了现有的最先进方法,验证了其有效性。

📝 摘要(中文)

现有的多模态长期记忆代理使用外部记忆来克服长视频中可用上下文的限制。然而,大多数方法强调存储内容而非如何检索存储的记忆。当检索不准确或无法获取有用证据时,现有代理缺乏从先前任务轨迹中诊断失败并调整未来搜索策略的机制。本文提出反思性检索记忆(RRM),为长时间跨度的多模态推理提供了一种反思性记忆框架。RRM通过反思性经验记忆增强了以实体为中心的多模态记忆图,提炼出来自历史任务轨迹的可转移程序检索知识。与保留当前视频事实证据的情节和语义记忆不同,反思性经验记忆捕捉跨任务的可重用搜索策略。RRM将检索到的经验转化为查询级指导,而答案生成仅依赖于从当前视频中新检索到的事实证据。生命周期管理机制进一步通过使用频率、重用反馈和时间衰减来调节经验记忆,从而减少冗余和噪声。RRM在M3-Bench-Robot、M3-Bench-Web和Video-MME-Long上始终优于之前的最先进方法,证明了反思性检索记忆在长时间跨度多模态推理中的有效性。

🔬 方法详解

问题定义:本文旨在解决现有多模态长期记忆代理在检索存储记忆时的准确性不足和适应性差的问题。现有方法往往侧重于存储内容,而忽视了如何有效检索这些内容的机制。

核心思路:反思性检索记忆(RRM)通过引入反思性经验记忆,提炼出历史任务轨迹中的可转移检索知识,从而优化检索策略。该设计旨在提高检索的准确性和有效性,使得代理能够更好地适应不同任务的需求。

技术框架:RRM的整体架构包括一个以实体为中心的多模态记忆图和一个反思性经验记忆模块。多模态记忆图用于存储当前视频的事实证据,而反思性经验记忆则捕捉跨任务的可重用搜索策略。整个流程包括经验记忆的检索、查询级指导的生成以及答案的生成。

关键创新:RRM的核心创新在于引入了反思性经验记忆,这一模块能够提炼出历史任务中的检索策略,与传统的情节和语义记忆形成鲜明对比。该创新使得代理在面对新任务时能够更灵活地调整检索策略。

关键设计:在设计中,RRM采用了生命周期管理机制,通过使用频率、重用反馈和时间衰减来调节经验记忆的有效性。此外,答案生成过程仅依赖于当前视频中新检索到的事实证据,确保了生成结果的准确性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在M3-Bench-Robot、M3-Bench-Web和Video-MME-Long等基准测试中,RRM的表现显著优于现有最先进方法,具体提升幅度达到XX%。这一结果验证了反思性检索记忆在长时间跨度多模态推理中的有效性。

🎯 应用场景

该研究的潜在应用领域包括智能视频分析、机器人导航和人机交互等。通过提升多模态推理的能力,RRM能够在复杂的场景中提供更为准确和高效的决策支持,具有重要的实际价值和未来影响。

📄 摘要(原文)

Existing multimodal long-term memory agents use external memory to overcome the limited context available for long videos. However, most methods emphasize what to store rather than how stored memory should be retrieved. When retrieval becomes inaccurate or repeatedly fails to obtain useful evidence, existing agents lack mechanisms to diagnose failures from previous task trajectories and adapt future search strategies.We introduce Reflective Retrieval Memory (RRM), a reflective memory framework for long-horizon multimodal reasoning. RRM augments an entity-centric multimodal memory graph with reflective experience memory, which distills transferable procedural retrieval knowledge from historical task trajectories. Unlike episodic and semantic memories that preserve factual evidence from the current video, reflective experience memory captures reusable search strategies across tasks. RRM converts retrieved experiences into query-level guidance, while answer generation remains conditioned only on factual evidence newly retrieved from the current video. A lifecycle management mechanism further regulates experience memory through usage frequency, reuse feedback, and temporal decay, thereby reducing redundancy and noise. RRM consistently outperforms previous state-of-the-art approaches on M3-Bench-Robot, M3-Bench-Web, and Video-MME-Long, demonstrating the effectiveness of reflective retrieval memory for long-horizon multimodal reasoning.