PRISM: Predictive Recomposition via Semantic Latent Decomposition for View-invariant Video Representation Learning
作者: Youngchae Chee, Hosu Lee, Sungjune Park, Junho Kim, Yong Man Ro
分类: cs.CV, cs.AI
发布日期: 2026-08-31
🔗 代码/项目: GITHUB
💡 一句话要点
提出PRISM以解决跨视角视频表示学习中的语义纠缠问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱六:视频提取与匹配 (Video Extraction)
关键词: 视频表示学习 视角不变特征 语义解耦 语言监督 跨视角学习
📋 核心要点
- 现有方法将视频编码为统一嵌入,导致视角不变和视角变化的语义交织,影响表示学习效果。
- PRISM通过将视频分解为视角不变和视角变化的潜在特征,并在语言监督下重组,解决了语义纠缠问题。
- PRISM在多个数据集上实现了最先进的性能,尤其在零样本设置下超越了其他领域内模型。
📝 摘要(中文)
跨视角视频表示学习旨在捕捉尽管在自我中心和外部中心视频中存在显著外观变化的情况下,仍能保持视角不变的动作语义。然而,现有方法将每个视频编码为统一的嵌入,导致视角不变和视角变化的语义不可避免地交织在一起。我们的关键见解是,当视角不变特征能够与任意视角变化特征充分重组,同时保持其独立语义时,才是真正的解耦。基于此,我们提出了PRISM,该方法将视频分解为视角不变和视角变化的潜在特征,并在语言监督下重组它们,从而促进这两条流的清晰解耦。PRISM在EgoExo4D、EgoExoLearn和AE2上实现了最先进的结果,甚至在零样本设置下超越了领域内模型。
🔬 方法详解
问题定义:论文旨在解决跨视角视频表示学习中,视角不变和视角变化语义的纠缠问题。现有方法未能有效解耦这两种语义,导致表示学习效果不佳。
核心思路:PRISM的核心思路是将视频分解为视角不变和视角变化的潜在特征,并通过语言监督进行重组,以确保两者的独立性和清晰性。这样的设计使得模型能够更好地捕捉和利用不同视角下的动作语义。
技术框架:PRISM的整体架构包括两个主要模块:视角不变特征提取模块和视角变化特征提取模块。首先,视频被分解为两个潜在特征流,然后通过语言监督进行重组,以促进特征的清晰解耦。
关键创新:PRISM的主要创新在于引入了语言监督机制来指导特征的重组,确保视角不变和视角变化特征的独立性。这一方法与传统的统一嵌入方法本质上不同,后者未能有效处理语义纠缠问题。
关键设计:在关键设计方面,PRISM采用了特定的损失函数来平衡视角不变和视角变化特征的学习,同时在网络结构上进行了优化,以提高特征提取的效率和准确性。
🖼️ 关键图片
📊 实验亮点
PRISM在EgoExo4D、EgoExoLearn和AE2数据集上实现了最先进的结果,尤其在零样本设置下超越了领域内模型,展示了显著的性能提升,验证了其有效性和优越性。
🎯 应用场景
该研究的潜在应用领域包括视频监控、行为识别和人机交互等。通过提高跨视角视频的表示学习能力,PRISM能够在多种实际场景中提供更准确的动作理解和分析,具有重要的实际价值和未来影响。
📄 摘要(原文)
Cross-view video representation learning aims to capture viewpoint-invariant action semantics despite substantial appearance changes across egocentric and exocentric videos. However, existing methods encode each video as a unified embedding, where view-invariant and view-variant semantics inevitably entangle under co-occurrences - a failure mode we show persists even in cross-view methods explicitly trained for view-invariance. Our key insight is that a view-invariant feature is truly disentangled when it can be sufficiently recomposed with an arbitrary view-variant feature while preserving their independent semantics. Building on this, we propose PRISM, that decomposes video into view-invariant and view-variant latents and recompose them under language supervision encouraging clean decomposition of the two streams. PRISM achieves state-of-the-art results on EgoExo4D, EgoExoLearn, AE2, even surpassing in-domain models under zero-shot setting. Code is available at https://github.com/litcoderr/prism.