MOSH-WM: Mask-Grounded Soft-Hamiltonian Dynamics for Object-Centric World Models

📄 arXiv: 2608.22750v1 📥 PDF

作者: Zhekai Wang, Haoxiang Huang, Xiang Liu, Zhikang Chen, Yueqing Sun, Qi Gu, Shiji Zhou, Miao Liu, Sen Cui

分类: cs.LG

发布日期: 2026-08-24

🔗 代码/项目: GITHUB


💡 一句话要点

提出MOSH-WM以解决对象中心世界模型的动态监督问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 对象中心模型 视频预测 动态监督 哈密顿动力学 深度学习 计算机视觉

📋 核心要点

  1. 现有对象中心世界模型在动态监督中使用的变量往往是无约束的视觉特征,导致预测性能不足。
  2. 本文提出的MOSH-WM通过掩模引导的软哈密顿动力学,使得状态显式依赖于图像支持,从而提高了预测准确性。
  3. 在OBJ3D和CLEVRER数据集上,MOSH-WM分别降低了25.0%和14.5%的LPIPS,显示出显著的性能提升。

📝 摘要(中文)

对象中心世界模型通过演化一组实体槽来预测未来视频,但现有方法中动态监督的变量往往是无约束的视觉特征。本文提出了一种基于掩模的软哈密顿世界模型(MOSH-WM),使得位置状态显式依赖于槽拥有的图像支持。通过冻结的视频槽编码器生成槽和掩模,掩模拥有的支持的空间矩形成规范状态Q,时间差形成P,学习的能量为有界学习增量提供软方向偏置。在OBJ3D和CLEVRER数据集上,MOSH-WM在视频预测任务中显著降低了LPIPS和空间均方误差,展现出更慢的误差累积速度。

🔬 方法详解

问题定义:本文旨在解决对象中心世界模型中动态监督变量无约束的问题,导致预测性能不足。现有方法未能有效利用图像支持信息。

核心思路:MOSH-WM通过掩模引导的软哈密顿动力学,使得状态的演变显式依赖于槽拥有的图像支持,从而提高了模型的预测能力和准确性。

技术框架:该模型包括一个冻结的视频槽编码器生成槽和掩模,利用掩模拥有的支持计算空间矩,形成规范状态Q,时间差形成P,最后通过学习的能量提供软方向偏置。

关键创新:MOSH-WM的核心创新在于将掩模引导的状态演变与软哈密顿动力学结合,使得模型在动态监督中显著提升了对图像支持的利用效率,与传统方法相比具有本质区别。

关键设计:模型中采用了分离存储的解码器相关外观和身份信息,使用门控组合器和有界残差将上下文与传播的相位状态结合,以重构解码器兼容的槽。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在OBJ3D数据集上,MOSH-WM在给定六帧观察的情况下,预测后续30帧时LPIPS降低了25.0%,空间均方误差降低了33.7%。在CLEVRER数据集上,LPIPS和空间均方误差的降低幅度分别为14.5%和18.7%。

🎯 应用场景

该研究的潜在应用领域包括机器人视觉、自动驾驶、虚拟现实等场景,能够提升系统对动态环境的理解和预测能力。未来,MOSH-WM有望在多模态学习和长时间序列预测中发挥重要作用。

📄 摘要(原文)

Object-centric world models forecast future videos by evolving a set of entity slots, but the variables receiving dynamics supervision are often unconstrained visual features. We introduce \method{}, a mask-grounded soft-Hamiltonian world model that makes its position-like state explicitly depend on slot-owned image support. A frozen video-slot encoder produces slots and masks; spatial moments of mask-owned support form a canonical state $Q$, temporal differences form $P$, and a learned energy supplies a soft directional bias to a bounded learned increment. Decoder-relevant appearance and identity are stored separately in a causal visual context. A gated composer and bounded residual then combine this context with the propagated phase state to reconstruct decoder-compatible slots. On OBJ3D, given six observed frames and evaluated over the following 30 frames, \method{} reduces LPIPS by 25.0\% and spatial MSE by 33.7\% relative to the strongest object-centric baseline. On CLEVRER, given six observed frames and evaluated over the following ten frames, the corresponding reductions are 14.5\% and 18.7\%. Horizon-resolved visual and object-state measurements show that the complete model accumulates error more slowly throughout the 30-frame closed-loop rollout. Project page:https://github.com/moshwm-anon/-moshwm-anon.github.io.