Towards Context-Aware Clinical Motion Understanding in Daily Living at Home: Freezing of Gait Detection with Egocentric Vision

📄 arXiv: 2608.13283v1 📥 PDF

作者: Vayalet Stefanova, Diwas Lamsal, Margot Genbrugge, Maxim Yudayev, Christian Schlenstedt, Moran Gilat, Bart Vanrumste, Benjamin Filtjens

分类: cs.AI

发布日期: 2026-08-13

备注: Accepted to ECCV Workshop 2026 (Human Motion Challenges in Real-World and Clinical Settings)


💡 一句话要点

提出基于自我中心视觉的运动理解方法以解决日常生活中的步态冻结检测问题

🎯 匹配领域: 支柱六:视频提取与匹配 (Video Extraction) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 步态冻结 自我中心视觉 多模态融合 可穿戴传感器 临床运动理解 帕金森病 时间卷积网络

📋 核心要点

  1. 核心问题:现有方法在日常生活中难以区分相似的运动模式,导致步态冻结的检测效果不佳。
  2. 方法要点:提出结合自我中心视觉与可穿戴IMU的多模态方法,以增强对步态冻结的理解和检测。
  3. 实验或效果:基于IMU的TCN在事件检测中表现最佳,F1值和AUROC分别达到42.3和83.0,显著优于自我中心视频特征。

📝 摘要(中文)

理解日常生活中的运动需要超越运动学的上下文,因为在日常活动中相似的惯性模式可能反映出意图停止、物体交互或病理性运动障碍。自我中心视觉提供了与任务相关的上下文,有助于消歧这些情况。本文通过对帕金森病患者的步态冻结(FOG)检测进行研究,探讨了这一挑战。使用同步的自我中心视频、可穿戴IMU和专家标注的FOG标签,评估了从预训练的自我中心视频和时间序列基础模型中提取的冻结表示,以及从头训练的基于IMU的TCN。在留一法评估中,基于IMU的TCN实现了最强的事件检测性能,F1值达到42.3,AUROC达到83.0,而V-JEPA2自我中心视频特征的F1值为32.6,AUROC为77.2。尽管自我中心视频未能超越基于IMU的传感,但其显示出超出随机的区分能力,定性分析表明自我中心视觉可能捕获与FOG相关的信息。综上所述,这些结果支持使用预训练的自我中心视频表示来为基于可穿戴传感器的临床运动理解添加上下文信息。

🔬 方法详解

问题定义:本文旨在解决日常生活中帕金森病患者步态冻结(FOG)检测的挑战。现有方法往往依赖单一的运动学数据,难以有效区分意图停止与病理性运动障碍,导致检测准确性不足。

核心思路:论文提出结合自我中心视觉和可穿戴IMU的多模态方法,通过引入上下文信息来提高FOG检测的准确性。自我中心视觉能够提供与任务相关的场景信息,有助于更好地理解运动意图。

技术框架:整体架构包括三个主要模块:自我中心视频数据采集、IMU数据采集和多模态融合模型。首先收集同步的自我中心视频和IMU数据,然后使用预训练的模型提取特征,最后通过基于IMU的TCN进行事件检测。

关键创新:最重要的技术创新在于将自我中心视觉与IMU数据结合,形成了一种新的多模态检测框架。与传统方法相比,该方法能够更全面地捕获运动上下文信息,从而提高检测性能。

关键设计:在模型设计中,使用了时间卷积网络(TCN)作为基于IMU的检测模型,采用了适当的损失函数以优化事件检测性能。同时,预训练的自我中心视频特征通过V-JEPA2模型提取,确保了上下文信息的有效性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,基于IMU的TCN在步态冻结检测中表现优异,F1值达到42.3,AUROC达到83.0,显著高于自我中心视频特征的32.6和77.2。这表明结合多模态信息能够有效提升运动理解的准确性。

🎯 应用场景

该研究的潜在应用领域包括老年人护理、康复医学和智能家居系统。通过提高步态冻结的检测能力,可以为帕金森病患者提供更好的监测和干预方案,进而改善其生活质量。未来,该方法有望扩展到其他运动障碍的检测与分析。

📄 摘要(原文)

Understanding motion in daily living requires context beyond kinematics, because similar inertial patterns during activities of daily living (ADLs) can reflect intentional stopping, object interaction, or pathological movement impairment. Egocentric vision provides task-related context that may help disambiguate these cases. We investigate this challenge through freezing of gait (FOG) detection in Parkinson's disease (PD), a symptom strongly influenced by contextual factors during ADLs. Using synchronized egocentric video, wearable IMUs, and expert-annotated FOG labels collected from 13 PD participants in their homes, we evaluate frozen representations from pretrained ego-video and time-series foundation models, alongside an IMU-based TCN trained from scratch, under leave-one-subject-out evaluation. The IMU-based TCN achieved the strongest event-detection performance, reaching 42.3 F1 and 83.0 AUROC, compared with 32.6 F1 and 77.2 AUROC for V-JEPA2 ego-video features. Although ego-video alone did not outperform IMU-based sensing, it showed above-chance discrimination, and qualitative analyses suggest that egocentric vision may capture FOG-relevant information independent of IMUs. Together, these results support the use of pretrained ego-video representations to add contextual information to wearable-sensor-based clinical motion understanding in daily living.