VidParse: Online Parsing of Egocentric Procedures Like a Pro

📄 arXiv: 2608.27562v1 📥 PDF

作者: Anubhav Gupta, Archit Kambhamettu, Vatsal Agarwal, Pulkit Kumar, Abhinav Shrivastava

分类: cs.CV

发布日期: 2026-08-27

备注: Accepted at ECCV 2026


💡 一句话要点

提出VidParse以解决自我中心视频解析中的复杂性问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱五:交互与反应 (Interaction & Reaction) 支柱六:视频提取与匹配 (Video Extraction) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 自我中心视频 在线解析 图约束推理 动作识别 时间相似性矩阵 束搜索解码器 多步骤解析

📋 核心要点

  1. 现有方法在处理自我中心视频时,容易受到重度自我运动和瞬态遮挡的影响,导致解析不准确。
  2. VidParse通过将活动理解视为图约束推理问题,动态识别语义转变,避免了传统方法的局限性。
  3. 实验结果表明,VidParse在复杂多步骤解析的准确性上相比于强基线提升了10倍,展示了其有效性。

📝 摘要(中文)

将连续、嘈杂的自我中心视频流转化为离散、时间顺序的动作步骤面临诸多视觉挑战。重度自我运动、瞬态遮挡以及无脚本人机交互的高类内变异性使得标准的帧级在线时间模型难以应对,常导致严重的过度分割和结构崩溃。为了解决这一问题,本文提出了VidParse,一个在线、无训练的框架,将活动理解视为图约束推理问题。该方法动态识别语义转变,利用时间相似性矩阵提取与操作相关的特征,并通过束搜索解码器显式强制有效的动作转变。通过将稳健的视觉片段锚定到硬性程序约束上,VidParse在复杂多步骤解析的准确性上实现了高达10倍的提升。

🔬 方法详解

问题定义:本文旨在解决自我中心视频流解析中的不稳定性问题,现有方法在面对重度自我运动和遮挡时表现不佳,导致解析结果不准确。

核心思路:VidParse通过将活动理解视为图约束推理问题,动态识别语义转变,利用时间相似性矩阵来提取与操作相关的特征,避免了依赖学习的时间滤波器。

技术框架:该框架包括特征提取模块、时间相似性矩阵构建、束搜索解码器和程序任务图。特征提取模块从冻结的基础模型中提取手-物体交互特征,后续模块则利用这些特征进行推理和解析。

关键创新:VidParse的主要创新在于其无训练的在线解析能力,通过图约束推理显著提高了复杂动作解析的准确性,与传统方法相比,减少了对低级感知的依赖。

关键设计:在设计中,VidParse使用了时间相似性矩阵来动态识别语义转变,并通过束搜索解码器强制有效的动作转变,确保了长距离状态转移的保留。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

VidParse在复杂多步骤解析的准确性上实现了高达10倍的提升,相比于强基线表现出显著的优势,展示了其在在线解析任务中的有效性和创新性。

🎯 应用场景

该研究在视频监控、智能家居、虚拟现实等领域具有广泛的应用潜力。通过准确解析自我中心视频流,能够提升人机交互的智能化水平,改善用户体验,并为自动化任务提供支持。

📄 摘要(原文)

Translating continuous, noisy egocentric video streams into discrete, temporally ordered action steps is fraught with visual challenges. Heavy ego-motion, transient occlusions, and the high intra-class variability of unscripted human-object interactions cause standard frame-level online temporal models to struggle, often resulting in severe over-segmentation and structural collapse. To bridge the gap between unstable low-level perception and high-level procedural logic, we present VidParse, an online, training-free framework that treats activity understanding as a graph-constrained inference problem. Rather than relying on learned temporal filters, we dynamically identify semantic transitions using a temporal similarity matrix over manipulation-anchored features, which are extracted from frozen foundation models to prioritize foreground hand-object interactions. A beam search decoder then leverages an induced procedural task graph to explicitly enforce valid action transitions and prune impossible trajectories. By anchoring robust visual segments to hard procedural constraints, our approach preserves long-range state transitions and achieves up to a 10x improvement in complex multi-step parsing accuracy over strong online baselines, all without requiring a single gradient update.