MASS: Multiplayer World Models with Authoritative Shared State
作者: Ziqi Cai, Siqi Yang, Yimu Wang, Zixian Gao, Yunheng Liu, Shuchen Weng, Erwin Wu, Kaipeng Zhang, Boxin Shi
分类: cs.CV, cs.HC
发布日期: 2026-08-06
💡 一句话要点
提出MAS以解决多玩家环境中的世界模型问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 多玩家环境 世界模型 逻辑引擎 渲染引擎 状态建模 跨视图一致性 游戏架构 人工智能
📋 核心要点
- 现有的视频世界模型在多玩家环境中表现不佳,主要由于世界状态与视图依赖的视觉潜变量的纠缠,导致计算冗余和视图不一致。
- MAS通过解耦世界动态和视图渲染,采用学习的逻辑引擎和渲染引擎,提供了一种新的多玩家世界模型架构。
- 在多玩家贪吃蛇基准测试中,MAS在状态准确性和跨视图一致性方面显著优于现有的多视图基线,支持高达1,024名玩家的并发模拟。
📝 摘要(中文)
当前的视频世界模型在多玩家环境中面临挑战,因为它们将世界状态与视图依赖的视觉潜变量纠缠在一起,导致计算冗余、视图不一致和扩展性差。为了解决这一限制,本文提出了MAS(多玩家世界模型与权威共享状态)。MAS借鉴了多玩家游戏架构,解耦了世界动态和视图渲染。通过学习的逻辑引擎,从联合动作中推进全球权威类型状态,而无需手写过渡函数,作为唯一的递归记忆和同步参考。基于这一共享状态,学习的渲染引擎按需生成独立且一致的视图。与现有的多视图基线相比,MAS在匹配的多玩家贪吃蛇基准上实现了更高的状态准确性和更低的跨视图不一致性。该方法支持1,024名玩家在10,000个递归步骤中推进预测世界。
🔬 方法详解
问题定义:本文旨在解决当前视频世界模型在多玩家环境中的不足,尤其是由于世界状态与视图依赖的视觉潜变量的纠缠,导致的计算冗余和视图不一致性问题。
核心思路:MAS的核心思路是通过解耦世界动态和视图渲染,采用学习的逻辑引擎作为全球权威状态的推进器,避免手写过渡函数,从而提高模型的可扩展性和一致性。
技术框架:MAS的整体架构包括两个主要模块:逻辑引擎和渲染引擎。逻辑引擎负责从玩家的联合动作中生成全球权威状态,而渲染引擎则根据这一状态生成独立且一致的视图。
关键创新:MAS的主要创新在于其明确的状态建模和解耦设计,使得模型能够在多玩家环境中实现更高的状态准确性和更低的跨视图不一致性,这是与现有方法的本质区别。
关键设计:在设计中,逻辑引擎和渲染引擎均为学习模型,逻辑引擎不依赖于手写的过渡函数,渲染引擎能够按需生成视图,确保了模型的灵活性和一致性。
🖼️ 关键图片
📊 实验亮点
在多玩家贪吃蛇基准测试中,MAS在状态准确性和跨视图一致性方面显著优于现有的多视图基线,支持高达1,024名玩家的并发模拟,且在10,000个递归步骤中表现出色,展示了其在多玩家环境中的强大能力。
🎯 应用场景
该研究的潜在应用领域包括多玩家在线游戏、虚拟现实和增强现实等场景。通过提供一致的多代理世界模拟,MAS能够为开发者提供更高效的工具,以创建复杂的交互式环境,提升用户体验。未来,该方法可能推动更大规模的多玩家模拟和智能体交互研究。
📄 摘要(原文)
Current video world models struggle in multiplayer environments because they entangle world state with view-dependent visual latents, leading to redundant compute, view inconsistencies, and poor scalability. We propose MAS (Multiplayer world models with Authoritative Shared State) to resolve this limitation. Inspired by multiplayer game architectures, MAS disentangles world dynamics and view rendering. A learned Logic Engine advances a global, authoritative typed state from joint actions without any hand-written transition function, acting as the sole recurrent memory and synchronization reference. From this shared state, a learned Rendering Engine generates independent and consistent views for any requested camera on demand. This explicit disentangling allows MAS to achieve superior state accuracy and lower cross-view inconsistency compared to state-of-the-art multi-view baselines on a matched multiplayer Snake benchmark. It advances predicted worlds with 1,024 concurrent players for 10,000 recurrent steps. Our results show that explicit, authoritative state modeling provides a practical foundation for scalable and consistent multi-agent world simulation.