Modeling What Changes: Sparse, Residual World Models for Object-Centric Manipulation
作者: Param Thakkar, Parsika Paresh Shah, Manisha Sushant Gote
分类: cs.RO, cs.AI
发布日期: 2026-09-02
💡 一句话要点
提出稀疏残差世界模型以提升物体中心操控的预测精度
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture)
关键词: 物体中心操控 稀疏模型 残差学习 物理预测 深度学习
📋 核心要点
- 现有的单一世界模型在每一步都需预测整个状态,导致对静态场景的重复预测和误差累积,影响物理预测的准确性。
- 本文提出了一种稀疏残差模型,通过显式建模物体变化,使用变化门和残差头来只对变化的物体进行扰动,从而提高预测的有效性和可解释性。
- 在MuJoCo基准测试中,稀疏模型在多个物体的情况下表现出显著的准确性提升,且在参数数量上大幅减少,展示了其在物体中心物理AI中的潜力。
📝 摘要(中文)
单一世界模型在每一步预测整个下一状态,导致对静态场景的重复预测和误差注入。本文探讨通过显式建模变化(每个物体的变化门和仅对标记物体施加扰动的残差头)是否能更有效地进行物理预测和控制。在MuJoCo桌面推理基准上,稀疏/残差模型在8个物体的情况下,预测下一状态姿态的准确性比密集多层感知器高出2.5到4.6倍,同时参数量减少至8.6到11.1倍。该模型在变化检测F1值上保持在0.80到0.87,而密集基线则表现不佳,且在不同物体数量间迁移时无需重新训练(99.4%的F1保留率),用四分之一的数据便能达到约90%的全数据准确性。在自回归展开中,该模型的误差累积远低于密集模型,保持在无运动的底线附近。最后,在基于采样的规划器中,预测模型失败,但经过特征化和训练后,稀疏模型开始规划,而密集模型在所有种子上均为零。
🔬 方法详解
问题定义:本文旨在解决现有单一世界模型在物体中心操控中的预测准确性不足和误差累积问题。现有方法在处理静态场景时效率低下,导致不必要的计算和错误传播。
核心思路:论文提出的稀疏残差模型通过显式建模物体的变化,使用变化门来指示需要关注的物体,并通过残差头仅对这些物体施加扰动,从而提高预测的准确性和可解释性。
技术框架:该模型的整体架构包括变化门和残差头两个主要模块。变化门负责识别场景中需要关注的物体,而残差头则对这些物体进行状态扰动。模型在训练过程中通过优化损失函数来提升预测精度。
关键创新:最重要的创新在于通过稀疏建模变化而非重预测整个场景,从而显著减少了参数数量和计算复杂度,同时提高了预测的准确性。与传统的密集模型相比,该方法在处理动态变化时表现出更好的稳定性和适应性。
关键设计:模型的设计包括对变化门的灵敏度调整和残差头的结构优化,确保在不同物体数量和状态下都能保持高效的预测性能。损失函数的选择也经过精心设计,以平衡预测准确性和模型复杂度。
🖼️ 关键图片
📊 实验亮点
实验结果表明,稀疏残差模型在8个物体的情况下,预测准确性比密集多层感知器高出2.5到4.6倍,同时参数量减少至8.6到11.1倍。此外,该模型在变化检测F1值上保持在0.80到0.87,展示了其在物体中心操控中的优越性能。
🎯 应用场景
该研究的潜在应用领域包括机器人操控、智能制造和自动驾驶等场景。在这些领域中,准确的物体状态预测对于实现高效的操作和决策至关重要。未来,该模型有望在更复杂的环境中应用,推动物理AI的发展。
📄 摘要(原文)
Monolithic world models predict the entire next state at every step, spending capacity re-predicting the static majority of a scene and injecting error into it. We ask whether explicitly modeling change (a per-object change gate plus a residual delta head that perturbs only the objects the gate flags) is a more effective and interpretable bias for physical prediction and control. On a MuJoCo tabletop pushing benchmark scaling from 3 to 8 objects, the sparse/residual model predicts next-state poses 2.5 to 4.6 times more accurately than a dense multilayer perceptron at 8.6 to 11.1 times fewer parameters, sustains change-detection F1 of 0.80 to 0.87 where the dense baseline is degenerate, transfers across object counts with zero retraining (99.4 percent F1 retention), and reaches about 90 percent of its full-data accuracy with a quarter of the data. In autoregressive rollout it compounds far less error, hugging the no-motion floor while the dense model drifts. Finally, inside a sampling-based planner, prediction-only models fail (though a true-simulator oracle solves the task with the identical planner, confirming the planner is sound), but once featurized and trained for the states a planner visits, the sparse model begins to plan (0.23 plus or minus 0.06 success over three seeds) while the dense monolith stays at zero at every seed. Modeling what changes, rather than re-predicting the whole world, is a simple, effective bias for object-centric physical AI; code, data generators, and all checkpoints will be released upon publication.