EM^2Mem: Event-Centric Multimodal Memory for Large Language Models

📄 arXiv: 2609.00551v1 📥 PDF

作者: Yijun Chen, Yaqi Zheng, Yanya Li, Boyi Xiao, Buqiang Xu, Shuofei Qiao, Jizhan Fang, Xinle Deng, Yunzhi Yao, Xuehai Wang, Liuxin Zhang, Hui Li, Huajun Chen, Shumin Deng

分类: cs.CL, cs.AI, cs.LG, cs.MM

发布日期: 2026-09-01

备注: Accepted by EMNLP 2026 findings

🔗 代码/项目: GITHUB


💡 一句话要点

提出EM^2Mem框架以解决长视频问答中的多模态记忆问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 长视频问答 多模态记忆 事件中心 信息检索 模型优化

📋 核心要点

  1. 现有的多模态记忆方法在长视频问答中常常只能检索孤立的片段,导致上下文重建困难。
  2. EM^2Mem框架通过事件锚点将异构证据绑定,提供了更有效的多模态记忆构建方式。
  3. 在长视频问答的实验中,EM^2Mem显著提升了准确率和召回率,同时减少了推理延迟和令牌使用。

📝 摘要(中文)

多模态记忆为长视频问答提供了可扩展的接口,但现有方法往往将字幕、帧、转录、摘要或图形事实作为孤立片段进行检索。这些片段虽然可搜索,但并不适合生成:语言模型在推理时必须重建跨模态和时间对齐,而此时上下文有限且归因困难。我们提出了EM^2Mem,一个事件中心的多模态记忆框架,在记忆构建过程中将异构证据绑定到事件锚点。每个事件索引的记忆单元对齐多模态记录、时间上下文、图形关联、语义事实和来源,从而实现基于基础多模态事件的紧凑证据读取,而不是特定模态的片段。在三个长视频问答基准上,EM^2Mem在最强记忆基线的基础上平均提高了2.0、2.4和3.7个百分点,严格的事件级Top-5证据召回率提高了7.0个百分点,查询延迟减少了4.67倍,总推理令牌减少了63.66%。

🔬 方法详解

问题定义:本论文旨在解决现有长视频问答方法中多模态记忆的不足,尤其是孤立片段的检索导致的上下文重建困难。

核心思路:EM^2Mem框架通过事件锚点将异构证据进行绑定,确保在记忆构建过程中能够有效对齐多模态记录和时间上下文,从而提高生成的有效性。

技术框架:该框架包括事件索引的记忆单元,能够整合多模态数据、时间上下文、图形关联及语义事实,形成紧凑的证据读取机制。

关键创新:EM^2Mem的核心创新在于事件中心的记忆构建方式,与传统方法相比,它能够更好地处理多模态数据的对齐与整合。

关键设计:在设计中,EM^2Mem采用了特定的参数设置以优化记忆单元的对齐效果,并通过损失函数确保多模态数据的有效整合。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在实验中,EM^2Mem在三个长视频问答基准上相较于最强记忆基线平均提高了2.0、2.4和3.7个百分点,严格的事件级Top-5证据召回率提高了7.0个百分点。同时,查询延迟减少了4.67倍,总推理令牌减少了63.66%。

🎯 应用场景

EM^2Mem框架在长视频问答、视频理解和多模态信息检索等领域具有广泛的应用潜力。其高效的多模态记忆构建方式可以为智能助手、教育平台和内容推荐系统等提供更精准的答案和信息检索能力,未来可能推动相关技术的进一步发展与应用。

📄 摘要(原文)

Multimodal memory offers a scalable interface for long-video question answering, but existing methods often retrieve captions, frames, transcripts, summaries, or graph facts as isolated fragments. Although searchable, such fragments are not generation-ready: language models must reconstruct cross-modal and temporal alignments at inference time, when context is limited and attribution is difficult. We propose EM^2Mem, an event-centric multimodal memory framework that binds heterogeneous evidence to event anchors during memory construction. Each event-indexed memory cell aligns multimodal records, temporal context, graph-linked relations, semantic facts, and provenance, enabling compact evidence readout over grounded multimodal events rather than modality-specific fragments. Across three long-video QA benchmarks, EM^2Mem improves average accuracy over the strongest memory baseline by 2.0, 2.4, and 3.7 points, improves strict event-level Top-5 evidence recall by 7.0 points, and reduces per-query latency by 4.67 times and total inference tokens by 63.66% (The code will be integrated into https://github.com/zjunlp/LightMem).