XP-JEPA: Cross-Predictive Physics Grounding for Forecastable Latent Dynamics
作者: Kehan Wen, Ziming Li, Siyuan Luo, Fan Shi
分类: cs.LG
发布日期: 2026-08-25
备注: Under review
💡 一句话要点
提出XP-JEPA以解决自预测模型的物理约束不足问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 潜在动态 自预测模型 物理约束 多任务学习 动态预测 机器人控制 智能监控
📋 核心要点
- 现有自预测模型在优化过程中可能导致对潜在转变的弱约束,影响预测精度。
- XP-JEPA通过将视觉观察与物理状态分开编码,并通过共享的预测器进行联合优化,增强了潜在动态的物理约束。
- 实验结果显示,XP-JEPA显著降低了回滚漂移,并提高了控制成功率,展示了其在动态预测中的有效性。
📝 摘要(中文)
潜在世界模型通过预测候选动作如何转变学习到的表示进行规划。然而,在自预测模型中,编码器和预测器是联合优化的,可能会共同适应那些容易预测但仅弱约束于场景物理演变的潜在转变。本文提出了交叉预测JEPA(XP-JEPA),将视觉潜在动态与特权物理轨迹相结合。XP-JEPA分别编码视觉观察和物理状态,通过共享的动作条件预测器推进两者,并将每个预测与未来表示相匹配。这一目标鼓励在两个模态之间实现统一的潜在动态,基于基础的物理转变。训练后,物理分支被丢弃,部署时仅保留视觉模型。在涵盖六个评估子系列的多任务套件上,XP-JEPA将新拟合预测器的回滚漂移从0.361降低到0.104,平均控制成功率从53.6%提高到78.2%。
🔬 方法详解
问题定义:本文旨在解决自预测模型中编码器和预测器联合优化导致的潜在动态弱约束问题。这种现象使得模型在物理演变的预测上存在不足,影响了控制效果。
核心思路:XP-JEPA的核心思想是通过交叉预测机制,将视觉信息与物理状态的动态进行分开编码,并通过共享的动作条件预测器进行联合优化,以增强潜在动态的物理约束。
技术框架:XP-JEPA的整体架构包括两个主要模块:视觉观察编码器和物理状态编码器。两者通过共享的预测器进行信息交互,最终通过匹配预测与未来表示来实现动态的统一。
关键创新:XP-JEPA的主要创新在于其交叉预测机制,能够有效地将视觉和物理信息结合,克服了传统自预测模型的局限性,使得潜在动态更加符合物理规律。
关键设计:在技术细节上,XP-JEPA采用了特定的损失函数来平衡视觉和物理预测的目标,同时在训练过程中保留了物理分支,训练完成后则只保留视觉模型以便于部署。该设计确保了模型在测试时的高效性与准确性。
🖼️ 关键图片
📊 实验亮点
XP-JEPA在多任务评估中表现出色,将新拟合预测器的回滚漂移从0.361降低至0.104,平均控制成功率从53.6%提升至78.2%。这一显著的性能提升表明了其在动态预测和控制中的有效性。
🎯 应用场景
XP-JEPA的研究成果在机器人控制、自动驾驶和智能监控等领域具有广泛的应用潜力。通过增强模型对动态环境的预测能力,XP-JEPA能够提升系统在复杂场景下的决策和控制效果,具有重要的实际价值和未来影响。
📄 摘要(原文)
Latent world models plan by predicting how candidate actions transform learned representations. In self-predictive models, however, the encoder and predictor are optimized jointly and can co-adapt to latent transitions that are easy to predict but only weakly constrained by the physical evolution of the scene. We introduce the cross-predictive JEPA (XP-JEPA), which grounds visual latent dynamics in privileged physical trajectories. XP-JEPA separately encodes visual observations and physical states, advances both through a shared action-conditioned predictor, and matches each prediction to both future representations. This objective encourages unified latent dynamics across the two modalities, grounded in the underlying physical transitions. The physical branch is discarded after training, leaving a visual-only model at deployment. On a multi-task suite spanning six evaluation subfamilies, XP-JEPA reduces rollout drift of a newly fitted predictor from $0.361$ to $0.104$ and increases mean control success from $53.6\%$ to $78.2\%$. Direct physical-state regression raises position decodability but leaves forecastability and control near the visual-only baseline. Cross-predictive physical grounding can therefore produce more forecastable latent dynamics for rollout-based control without privileged inputs at test time.