MemWM: Memory-Augmented Text-Based World Model

📄 arXiv: 2608.07107v1 📥 PDF

作者: Yujun Wang, Tao Zhang, Jinhe Bi, Aniri, Wenxuan Ye, Boliang Liu, Sikuan Yan, Shuning Wang, Xuebing Zhou, Sören Pirk, Hinrich Schütze, Yunpu Ma

分类: cs.AI

发布日期: 2026-08-07


💡 一句话要点

提出MemWM以解决文本基础世界模型的系统性预测错误问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 世界模型 增强记忆 状态预测 智能体规划 机器学习

📋 核心要点

  1. 现有的世界模型在预测环境状态时存在系统性错误,可能导致关键任务信息的遗漏或错误的状态转移。
  2. 本文提出MemWM,通过引入世界记忆来增强文本基础世界模型,改善下一个状态的预测准确性。
  3. 实验结果表明,增强记忆的智能体在多个任务上相较于传统方法有显著提升,成功率提高了最高65.4%。

📝 摘要(中文)

世界模型越来越多地用于支持智能体的规划,通过预测环境状态如何响应智能体的动作。然而,流畅的下一个状态预测仍可能遗漏任务关键事实、损坏产品属性或应用错误的转移规则。为了解决这些系统性预测错误,本文提出了MemWM,一种增强记忆的文本基础世界模型。MemWM利用世界记忆,即一个策划的转移规则、状态缓存和难以预测事实的记忆库,来条件下一个状态的想象。通过结构化状态保真度(SSF)评估事实状态的保留,结果显示,增强记忆的训练在SSF上提高了最多206.3%。在完整的规划设置中,我们保持策略模型不变,并提供策略侧的世界技能:检索的任务级技能和逐步纠正指导。通过ALFWorld、WebShop和ScienceWorld,增强记忆的智能体在下游成功率上超过了SFT训练的世界模型智能体,最高提升达65.4%。

🔬 方法详解

问题定义:本文旨在解决现有文本基础世界模型在状态预测中存在的系统性错误问题,包括遗漏关键事实和应用错误的转移规则。现有方法在复杂任务中表现不佳,导致智能体规划能力受限。

核心思路:MemWM通过引入一个策划的世界记忆库,包含转移规则、状态缓存和难以预测的事实,来改善下一个状态的预测。这样的设计使得智能体能够更好地利用历史信息,从而提高预测的准确性和可靠性。

技术框架:MemWM的整体架构包括三个主要模块:世界记忆模块、状态预测模块和策略指导模块。世界记忆模块负责存储和检索关键的转移规则和状态信息,状态预测模块利用这些信息进行下一个状态的想象,而策略指导模块则提供任务级技能和纠正指导。

关键创新:MemWM的核心创新在于引入了世界记忆这一概念,显著提升了状态预测的准确性。与现有方法相比,MemWM能够有效减少系统性预测错误,增强智能体在复杂环境中的决策能力。

关键设计:在设计中,使用结构化状态保真度(SSF)作为评估指标,确保预测状态的准确性。模型的训练过程中,采用了增强记忆的策略,使得智能体在不同的记忆和动作预算设置下都能保持较高的任务成功率和效率。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,MemWM在多个基准任务上显著提高了智能体的成功率,相较于传统SFT训练的世界模型,成功率提升最高达65.4%。此外,增强记忆的训练在结构化状态保真度(SSF)上提高了206.3%,验证了其有效性。

🎯 应用场景

该研究的潜在应用领域包括智能体规划、机器人导航和虚拟环境交互等。通过提高智能体在复杂任务中的决策能力,MemWM可以在自动化、游戏开发和人机交互等多个领域产生实际价值,推动智能体技术的进一步发展。

📄 摘要(原文)

World models are increasingly used to support planning in agents by predicting how environment states evolve in response to agent actions. Yet fluent next-state predictions can still omit task-critical facts, corrupt product attributes, or apply incorrect transition rules. To address such systematic prediction errors, we introduce MemWM, a memory-augmented text-based world model. MemWM uses world memory, a curated memory bank of transition rules, state caches, and hard-to-predict facts, to condition next-state imagination. We evaluate factual state preservation with Structured State Fidelity (SSF), which scores predicted states through benchmark-specific facts and fields. Compared with SFT, memory-augmented training improves SSF by up to 206.3%. In the full planning setting, we keep the policy model frozen and provide policy-side world skill: retrieved task-level skills and step-wise corrective guidance for action selection. Across ALFWorld, WebShop, and ScienceWorld, memory-augmented agents improve downstream success over an SFT-trained world-model agent, with up to a 65.4% relative gain. Sensitivity analyses further show that retrieved memory improves task success and efficiency under different memory and action-budget settings.