Toward Physically Grounded JEPA World Models for Goal-Conditioned Robotic Planning
作者: Muyuan Liu, Yue Huang, Zheng Liang, Xiang Gao
分类: cs.RO, cs.AI, cs.LG
发布日期: 2026-09-03
备注: 5 pages, 4 figures, 2 tables. Accepted to the IROS 2026 Workshop on Physical World Models for Scaling Embodied AI (PWMS 2026)
💡 一句话要点
提出一种基于JEPA的世界模型以解决机器人目标规划问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: JEPA世界模型 逆动力学 状态对齐 机器人规划 潜在表示 自主机器人 智能制造
📋 核心要点
- 现有的JEPA世界模型在机器人控制中未能有效保留与动作相关的信息,限制了其规划能力。
- 本文提出的模型通过结合逆动力学和状态对齐,增强了潜在表示的有效性,提升了规划性能。
- 在四个基准任务中,模型在TwoRoom、PushT和OGBench-Cube上取得了最高成功率,验证了方法的有效性。
📝 摘要(中文)
本文提出了一种端到端的JEPA世界模型,通过逆动力学和状态对齐增强潜在预测,旨在解决现有方法在机器人控制中信息保留不足的问题。逆动力学有助于防止潜在崩溃,使潜在转移信息与产生这些转移的动作相关,而状态对齐则将连续表示与其物理配置和运动关联。实验结果表明,该模型在多个基准任务中表现优异,成功率显著提升。
🔬 方法详解
问题定义:本文旨在解决现有JEPA世界模型在机器人目标规划中未能有效保留与控制相关信息的问题。现有方法的潜在预测不足以支持复杂的机器人控制任务。
核心思路:提出的模型通过引入逆动力学(IDM)和状态对齐(SA),增强了潜在表示的有效性。逆动力学有助于防止潜在崩溃,而状态对齐则确保了连续表示与物理状态的关联。
技术框架:整体架构包括潜在表示学习、逆动力学模块和状态对齐模块。潜在表示学习负责生成动作条件下的潜在状态,逆动力学模块用于优化潜在转移,而状态对齐模块则确保表示与物理配置一致。
关键创新:最重要的创新在于结合了逆动力学和状态对齐,使得潜在表示不仅能反映动作信息,还能与物理状态紧密关联。这一设计显著提升了规划的成功率。
关键设计:模型中采用了特定的损失函数来平衡逆动力学和状态对齐的影响,确保在训练过程中两者的有效结合。同时,网络结构经过优化,以提高潜在表示的维度和信息保留能力。
🖼️ 关键图片
📊 实验亮点
实验结果显示,提出的模型在TwoRoom任务中成功率达到100%,PushT任务为98%,OGBench-Cube为87%。与LeWorldModel相比,尽管后者在OGBench-Cube上表现更好,但本模型在转移维度上表现出更高的有效性,证明了状态对齐在机器人规划中的重要性。
🎯 应用场景
该研究具有广泛的应用潜力,尤其是在自主机器人、智能制造和人机协作等领域。通过提升机器人在复杂环境中的规划能力,能够实现更高效的任务执行和决策支持,推动智能机器人技术的发展。
📄 摘要(原文)
Action-conditioned JEPA world models enable planning toward visually specified goals without reconstructing future pixels, yet latent prediction alone does not explicitly encourage the learned representations to retain information relevant to robotic control. We introduce an end-to-end JEPA world model that augments latent prediction with inverse dynamics (IDM) and state alignment (SA). While inverse dynamics discourages latent collapse and makes latent transitions informative of the actions that produced them, state alignment grounds consecutive representations in their associated physical configuration and motion. Across four benchmark tasks, our model attains the highest success rates on TwoRoom (100%), PushT (98%), and OGBench-Cube (87%), while performing comparably to LeWorldModel on Reacher. Our ablation further shows that adding state alignment consistently improves planning success over IDM alone across all four tasks. Although LeWorldModel, our primary baseline, attains higher average straightening on OGBench-Cube, transition-subspace analysis shows that its transition energy is concentrated in a substantially lower-dimensional subspace. Our state-aligned model exhibits a higher effective transition dimension than LeWorldModel and improves planning over IDM alone, supporting state alignment as an effective complement to inverse dynamics for robotic planning.