UniJEPA: A Unified Joint-Embedding Predictive Architecture for Task-Agnostic Visual World Modeling
作者: An Lanji, Dawei Liu, Jin Li, Haoran Xu, Mei Chen, Yu Tian
分类: cs.CV
发布日期: 2026-08-07
备注: 10 pages, 7 figures; Accepted by ICML2026
💡 一句话要点
提出UniJEPA以统一图像与视频的世界建模
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 联合嵌入预测 自监督学习 世界建模 图像处理 视频理解 规划算法 深度学习
📋 核心要点
- 现有的联合嵌入预测架构方法存在碎片化问题,无法有效整合图像级和视频级的世界建模任务。
- UniJEPA通过共享潜在空间,联合学习光度预测和时间预测,采用单一的训练目标,简化了模型架构。
- 在多个图像、视频和控制基准上,UniJEPA的性能与特定任务的JEPA相当或更优,且规划速度显著提升。
📝 摘要(中文)
联合嵌入预测架构(JEPA)作为自监督学习世界模型的框架,现有方法存在碎片化问题,无法统一图像级和视频级建模。本文提出UniJEPA,通过共享潜在空间,联合学习光度预测和时间预测,采用单一的端到端目标,显著提升了模型的训练效率和效果。实验结果表明,UniJEPA在多个基准测试中表现优异,且在规划速度上显著快于现有生成世界模型。
🔬 方法详解
问题定义:本文旨在解决现有联合嵌入预测架构(JEPA)方法的碎片化问题,现有方法在图像和视频建模上使用不同的编码器和预测器,限制了模型的统一性和效率。
核心思路:UniJEPA的核心思想是通过一个共享的潜在空间,联合学习光度预测(图像级)和时间预测(视频级),从而实现图像和视频建模的统一。这样的设计使得模型能够在同一框架下处理不同类型的输入,提升了学习效率。
技术框架:UniJEPA的整体架构包括一个共享的编码器和预测器,采用单一的端到端目标函数,结合下一个嵌入预测损失和高斯正则化。该框架能够从原始像素中直接训练,而无需使用EMA、停止梯度或预训练编码器。
关键创新:UniJEPA的主要创新在于其统一的潜在空间设计,使得光度预测学习不变结构,而时间预测学习等变动态。这种设计与现有方法的分离处理方式形成鲜明对比,显著提升了模型的灵活性和适应性。
关键设计:UniJEPA的损失函数由下一个嵌入预测损失和高斯正则化组成,确保了编码器和预测器的抗崩溃特性。此外,模型在训练过程中无需复杂的超参数设置,仅需一个损失超参数即可实现高效训练。
🖼️ 关键图片
📊 实验亮点
在实验中,UniJEPA在图像、视频和控制基准上表现出色,性能与特定任务的JEPA相当或更优。同时,UniJEPA的规划速度比现有生成世界模型快数十倍,且在准确性上保持竞争力,展示了其在实际应用中的巨大潜力。
🎯 应用场景
UniJEPA在多个领域具有广泛的应用潜力,包括机器人导航、自动驾驶、虚拟现实等。通过实现高效的世界建模和规划能力,该模型能够在复杂环境中进行实时决策,提升智能系统的自主性和灵活性。未来,随着技术的进一步发展,UniJEPA可能在更多实际应用中发挥重要作用。
📄 摘要(原文)
Joint-Embedding Predictive Architectures (JEPAs) have emerged as a principled framework for self-supervised learning of world models in compact latent spaces, yet existing methods are fragmented: some predict masked parts of a single image in latent space (I-JEPA), others learn to predict global photometric transformations (Image World Models), while video-scale JEPAs predict future temporal states and are post-trained for action-conditioned planning (V-JEPA~2, DINO-World, DINO-WM). These objectives are treated as distinct recipes with separate encoders, predictors, and anti-collapse regularizers, hindering a single model from unifying image-level and video-level world modeling. We present UniJEPA, a unified JEPA that jointly learns photometric prediction (image-level transformations) and temporal prediction (video-level next-state dynamics) in one shared latent space. A single end-to-end objective, composed of a next-embedding prediction loss and a Gaussian regularizer, yields a provably anti-collapse encoder-predictor pair trainable from raw pixels without EMA, stop-gradient, or pre-trained encoders. We show that the same latent space supports controllable abstraction: photometric prediction learns invariant structure while temporal prediction learns equivariant dynamics. After action-conditioned post-training on offline trajectories, UniJEPA enables zero-shot planning by treating goal features as prediction targets. On image, video, and control benchmarks, UniJEPA matches or surpasses task-specific JEPAs while requiring a single loss hyperparameter, and plans up to tens of times faster than generative world models at comparable accuracy.