Code World Model: Coding Agent as World Brain

📄 arXiv: 2608.25927v1 📥 PDF

作者: Yiwen Chen, Guosheng Lin, Chi Zhang

分类: cs.CV, cs.AI, cs.CL

发布日期: 2026-08-26

备注: Project Page: https://buaacyw.github.io/cwm/


💡 一句话要点

提出Code World Model以解决视频世界模型的局限性问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱八:物理动画 (Physics-based Animation)

关键词: 世界模型 编码代理 视频生成 时空约束 开放式世界 人工智能 自主学习

📋 核心要点

  1. 现有视频世界模型主要依赖视觉观察学习动态,难以捕捉支配环境演变的深层知识和规则。
  2. 本文提出的Code World Model框架,通过编码代理推理事件并生成可执行代码,实现世界演变与视觉生成的分离。
  3. 实验结果表明,经过微调的MiniMax-H3在简单交互世界中能够遵循代理时空规范,保留丰富的视觉细节,展示了该方法的有效性。

📝 摘要(中文)

世界模型旨在模拟复杂环境在行动和事件下的演变,但现有基于视频的世界模型主要从视觉观察中学习动态,难以揭示支配世界演变的知识、规则和机制。本文提出Code World Model框架,通过结合语言模型的推理和编码能力与视频模型的生成先验,分离世界演变与视觉实现。编码代理作为世界大脑,推理事件及其后果,并生成可执行代码以维持持久的世界状态和执行规则一致的演变。我们引入代理表示,编码逐帧时空约束,并编译为代理视频,以条件视频模型生成高保真视觉观察。经过微调,MiniMax-H3能够遵循编码代理构建的简单交互世界中的代理时空规范,同时保留丰富的视觉细节和动态。这些结果展示了将代码与视频模型结合以实现持久世界演变的新路径。

🔬 方法详解

问题定义:本文旨在解决现有视频世界模型无法有效捕捉环境演变背后知识和规则的问题,导致持久性后果难以维护。

核心思路:通过将世界演变与视觉实现分离,结合语言模型的推理能力和视频模型的生成能力,提出编码代理作为世界大脑,生成可执行代码以维持世界状态。

技术框架:整体架构包括编码代理、代理表示和视频模型三个主要模块。编码代理负责推理和生成代码,代理表示编码时空约束,视频模型则用于生成高保真的视觉输出。

关键创新:最重要的创新在于引入编码代理和代理表示的结合,使得世界演变与视觉生成可以独立进行,突破了传统视频模型的局限。

关键设计:在设计中,采用了特定的损失函数来优化代理表示与视频模型之间的对齐,同时在网络结构上进行了调整,以支持高效的时空约束编码。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,经过微调的MiniMax-H3在简单交互世界中成功遵循代理时空规范,保留了丰富的视觉细节和动态,展示了与基线模型相比显著的性能提升,具体提升幅度未知。

🎯 应用场景

该研究的潜在应用领域包括游戏开发、虚拟现实和机器人控制等。通过实现持久的世界状态和灵活的视觉生成,Code World Model能够为开放式世界的构建提供新的解决方案,推动智能体在复杂环境中的自主学习与适应能力。

📄 摘要(原文)

World models aim to simulate how complex environments evolve under actions and events, yet existing video-based world models primarily learn dynamics from visual observations, which reveal outcomes rather than the underlying knowledge, rules, and mechanisms governing world evolution. This makes it difficult to maintain persistent consequences and support coherent, open-ended evolution. We introduce Code World Model, a framework that separates world evolution from visual realization by combining the reasoning and coding capabilities of language models with the generative priors of video models. A coding agent serves as the world brain, reasoning about events and their consequences and generating executable code to maintain persistent world state and perform rule-consistent evolution. To connect executable state with visual generation, we introduce a proxy representation that encodes frame-wise spatiotemporal constraints and is compiled into a proxy video, which conditions a video model to render high-fidelity visual observations. We further develop data pipelines for constructing aligned proxy-observation pairs from gameplay and real-world videos. After fine-tuning on paired gameplay data, MiniMax-H3 follows proxy-based spatiotemporal specifications from simple interactive worlds built by the coding agent while preserving rich visual details and dynamics. These results demonstrate the potential of combining code for persistent world evolution with video models for flexible visual realization, providing a new path toward open-ended world models.