H3-World: Turning Language Understanding into World Control

📄 arXiv: 2609.01560v1 📥 PDF

作者: Danze Chen, Zeqing Wang, Ziyue Lin, Xingyi Yang, Yeying Jin

分类: cs.CV, cs.AI

发布日期: 2026-09-01


💡 一句话要点

提出H3-World以实现语言理解驱动的世界控制

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 视频生成 自然语言处理 世界控制 时间注意力 交互式模型 机器学习 角色控制 相机运动

📋 核心要点

  1. 现有方法在视频生成与控制之间缺乏有效的连接,导致控制精度不足。
  2. H3-World通过将语言指令与视频生成器的潜在表示对齐,实现了精确的世界控制。
  3. 实验表明,H3-World在仅用少量样本和参数的情况下,成功实现了高质量的角色与相机控制。

📝 摘要(中文)

我们提出了H3-World,这是一个高效的框架,将33B MiniMax-H3视频生成器转变为交互式世界模型。我们的关键发现是,随着大型视频生成器能力的提升,语言逐渐成为控制的自然接口。MiniMax-H3已经支持通过自然语言指令进行角色行为和相机运动的零-shot控制。基于此,H3-World将粗略的语言接口转变为精确、时间上有依据的世界控制,而无需引入专门的动作模块。具体而言,我们将每个动作表示为角色和相机指令的结构化组合,并将其与相应的时间视频潜变量对齐。为了使控制在时间上精确,我们进一步引入了时间注意力路由,限制每个指令在其预定时间区间内,从而减少动作间的控制泄漏。H3-World直接重用在大规模视频预训练中学习的语义表示,仅需轻量级适应。通过仅使用8000个游戏样本、10000次LoRA优化步骤和0.199%的可训练参数,H3-World实现了有效的角色和相机控制,同时保持了强大的生成质量,并且能够推广到未见场景。这些结果表明,大型视频生成器中涌现的控制能力可以有效转化为交互式世界控制。

🔬 方法详解

问题定义:论文要解决的问题是如何将大型视频生成器的能力有效转化为精确的世界控制。现有方法在控制精度和时间一致性方面存在不足,无法充分利用语言作为控制接口。

核心思路:H3-World的核心思路是将语言指令与视频生成器的潜在表示进行结构化对齐,从而实现精确的控制。通过时间注意力路由,确保每个指令在其指定的时间区间内执行,减少了控制的模糊性。

技术框架:H3-World的整体架构包括三个主要模块:语言指令解析、时间注意力路由和视频生成器控制。首先解析自然语言指令,然后通过时间注意力路由将指令与视频生成器的潜在表示对齐,最后实现角色和相机的控制。

关键创新:H3-World的关键创新在于引入了时间注意力路由机制,使得控制指令能够在时间上精确匹配,避免了传统方法中的控制泄漏问题。这一设计显著提升了控制的准确性和响应速度。

关键设计:在参数设置上,H3-World仅使用了8000个游戏样本和0.199%的可训练参数,结合10000次LoRA优化步骤,确保了高效的训练过程。损失函数和网络结构经过精心设计,以支持高质量的生成与控制。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

H3-World在实验中仅使用8000个样本和0.199%的可训练参数,经过10000次LoRA优化步骤,实现了高效的角色与相机控制,生成质量保持强大。此外,该方法能够有效推广到未见场景,展示了其良好的泛化能力。

🎯 应用场景

H3-World的研究成果具有广泛的应用潜力,尤其在游戏开发、虚拟现实和交互式媒体等领域。通过自然语言控制角色和场景,用户可以更直观地与虚拟世界互动,提升沉浸感和用户体验。未来,该技术还可能扩展到教育、培训和模拟等多个领域,推动人机交互的进一步发展。

📄 摘要(原文)

We present H3-World, an efficient framework that turns the 33B MiniMax-H3 video generator into an interactive world model. Our key finding is that, as large video generators become more capable, language is emerging as a natural interface for control. MiniMax-H3, for example, already supports zero-shot control of character behavior and camera motion through natural-language instructions. Building on this, H3-World turns this coarse language interface into precise, temporally grounded world control, without introducing dedicated action modules. Specifically, we represent each action as a structured combination of character and camera instructions, and align them with the corresponding temporal video latents. To make the control temporally precise, we further introduce temporal attention routing, which restricts each instruction to its intended time interval and reduces control leakage across actions. Importantly, H3-World directly reuses the semantic representations learned during large-scale video pretraining and requires only lightweight adaptation. With only 8,000 gameplay samples, 10,000 LoRA optimization steps, and 0.199% trainable parameters, H3-World achieves effective character and camera control while preserving strong generation quality. It also generalizes to unseen scenarios. These results show that the control capabilities emerging in large video generators can be efficiently transformed into interactive world control.