SR-JEPA: Learning Predictive Latent State in 3D Scenes
作者: Zihan Zhou, Qifu Wen, Xi Zeng
分类: cs.CV, cs.LG
发布日期: 2026-08-06
备注: 17 pages, 5 figures, 9 tables
💡 一句话要点
提出SR-JEPA以解决3D场景中缺失实体的预测问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 3D场景理解 潜在表示 预测模型 计算机视觉 自我学习 语义识别 点云处理
📋 核心要点
- 现有的联合嵌入预测架构在处理缺失实体时存在局限,主要依赖生成的编码器进行评估,未能充分利用预测路径的潜力。
- SR-JEPA通过在3D场景中查询冻结的预测路径,提出了一种新的方法来处理缺失实体的预测,避免了对重建和语义标签的依赖。
- 在多个实验中,SR-JEPA在语义身份准确率和AP指标上显著超越了现有方法,展示了其在3D场景理解中的有效性。
📝 摘要(中文)
联合嵌入预测架构通过预测缺失观察的潜在表示进行学习,但许多掩蔽的JEPAs主要通过其生成的编码器进行评估。本文提出SR-JEPA,一种针对场景规模点云的点本地JEPA,其原始的冻结预测路径可以在提供的位置进行查询。在评估时,移除一个对象的每个点,然后在其质心处用相同形状的32点查询替换。训练仅使用自包含的3D EMA目标,不涉及重建、语义标签、语言或提升的2D特征。在5,953个保留的ARKitScenes对象上,插补的潜在表示达到了43.13%的语义身份宏观准确率,比最强基线高出22.18点。随机化预测路径减少了9.78点,而替换匹配的捐赠上下文则减少了21.98点。结果揭示了一个可查询的、组合的3D预测状态:模型完成上下文相关的实体内容,后续计算与度量几何结合。
🔬 方法详解
问题定义:本文旨在解决在3D场景中缺失实体的预测问题。现有方法主要通过编码器评估,未能充分利用预测路径的潜力,导致性能不足。
核心思路:SR-JEPA的核心思路是通过查询冻结的预测路径来推断缺失实体的潜在表示,避免了对重建和额外信息的依赖,从而提高了模型的自我学习能力。
技术框架:SR-JEPA的整体架构包括数据预处理、模型训练和评估三个主要阶段。在训练阶段,模型使用自包含的3D EMA目标进行学习;在评估阶段,通过移除对象的点并用查询点替代进行预测。
关键创新:SR-JEPA的主要创新在于其点本地的设计,使得模型能够在缺失实体的情况下仍然进行有效的预测。这一设计与传统方法的本质区别在于不依赖于重建或外部语义信息。
关键设计:在模型设计中,使用了32点的查询机制来替代缺失的点,并且训练过程中采用了自包含的3D EMA目标,确保了模型的学习过程不受外部信息的干扰。
🖼️ 关键图片
📊 实验亮点
SR-JEPA在5,953个ARKitScenes对象上达到了43.13%的语义身份宏观准确率,比最强基线高出22.18点。此外,在8,570个Sr3D支持对上,完整潜在表示达到了41.15 AP,缺失对象的潜在表示结合锚点身份和几何达到了39.37 AP,显示出显著的性能提升。
🎯 应用场景
SR-JEPA在3D场景理解和计算机视觉领域具有广泛的应用潜力,尤其是在自动驾驶、机器人导航和虚拟现实等领域。其能够有效处理缺失信息的能力,将为这些领域的智能系统提供更强的环境理解能力和决策支持。
📄 摘要(原文)
Joint-embedding predictive architectures learn by predicting latent representations of missing observations, yet many masked JEPAs are evaluated primarily through the encoders they produce. We ask what a trained predictive pathway itself infers when an entire entity is absent from a native 3D scene. We introduce SR-JEPA, a point-native JEPA for scene-scale point clouds whose original frozen predictive pathway can be queried at a supplied location. At evaluation, every point of one object is removed before encoding and replaced by the same shape-free 32-point query at its centroid. Training uses only self-contained 3D EMA targets: no reconstruction, semantic labels, language, or lifted 2D features. On 5,953 held-out ARKitScenes objects, the imputed latent reaches 43.13% semantic-identity macro accuracy, 22.18 points above the strongest floor. Randomizing the prediction path removes 9.78 points, while substituting matched donor context removes 21.98 points. On 8,570 Sr3D support pairs, the full latent reaches 41.15 AP; identity decoded from the missing-object latent, combined with anchor identity and geometry, reaches 39.37 AP, leaving an unresolved 1.78-point residual. These results reveal a queryable, compositional 3D predictive state: the model completes context-dependent entity content, which downstream computation combines with metric geometry.