Autonomous Telerehabilitation via Skeletal Motion Prediction and Joint-Level Performance Assessment
作者: Lara Pereira, João Ruivo Paulo, Pedro Santos, Paulo Peixoto
分类: cs.CV, cs.LG
发布日期: 2026-08-12
备注: Accepted at IEEE RO-MAN2026
💡 一句话要点
提出基于骨骼运动预测的自主远程康复系统以解决缺乏持续监督的问题
🎯 匹配领域: 支柱七:动作重定向 (Motion Retargeting) 支柱八:物理动画 (Physics-based Animation)
关键词: 自主康复 运动预测 骨骼识别 深度学习 远程医疗 运动质量评估 辅助机器人
📋 核心要点
- 现有的康复方法往往依赖于治疗师的持续监督,难以实现自主性和可扩展性。
- 本文提出的系统通过骨骼运动预测和关节级性能评估,能够在无监督的情况下提供反馈,提升用户体验。
- 实验结果显示,分类器在深蹲任务上达到了96.45%的准确率,运动预测模块在Human3.6M数据集上表现优异,平均关节位置误差为75.8毫米。
📝 摘要(中文)
自主康复系统不仅需要识别人体运动,还需提供结构化反馈,以支持用户在没有持续治疗师监督的情况下进行康复。本文提出了一种远程康复管道,集成了基于骨骼的运动质量评估和短期运动预测,形成一个在无标记RGB视频上运行的双模块系统。自注意力双向LSTM通过MMD-NCA度量学习进行运动质量分类,而基于图的运动预测模块计算预测与观察姿态之间的每个关节位置误差,生成空间局部偏差信号。每个模块在已建立的基准上独立评估:分类器在PROZIS数据集的深蹲序列上实现了96.45%的平均分类准确率,采用的STARS预测器在Human3.6M上以560毫秒的时间达到了75.8毫米的平均关节位置误差,超越了所有预测时间范围内的图形和递归基线。该框架旨在最终部署于辅助机器人和家庭康复环境中;端到端集成和临床验证是未来的重要方向。通过将运动识别和预测结合在一个系统中,这项工作为自主、反馈驱动的远程康复迈出了重要一步,旨在提供更可及和可扩展的康复解决方案。
🔬 方法详解
问题定义:本文旨在解决现有康复系统缺乏自主性和实时反馈的问题,现有方法通常需要治疗师的持续监督,限制了康复的可及性和效率。
核心思路:论文提出了一种双模块系统,结合运动质量评估和短期运动预测,利用无标记RGB视频进行自主康复,旨在为用户提供实时反馈。
技术框架:系统由两个主要模块组成:自注意力双向LSTM模块用于运动质量分类,基于图的运动预测模块用于计算关节位置误差。两个模块独立评估,确保系统的整体性能。
关键创新:最重要的创新在于将运动识别与预测结合在一个框架中,利用MMD-NCA度量学习提升分类性能,同时通过空间局部偏差信号增强运动预测的准确性。
关键设计:分类器采用自注意力机制和双向LSTM结构,损失函数基于MMD-NCA设计;运动预测模块则使用图结构来计算每个关节的预测误差,确保精确度和实时性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,分类器在PROZIS数据集的深蹲序列上达到了96.45%的平均分类准确率,而STARS预测器在Human3.6M数据集上以560毫秒的时间达到了75.8毫米的平均关节位置误差,超越了所有基线模型,展示了显著的性能提升。
🎯 应用场景
该研究的潜在应用领域包括家庭康复、老年人护理和辅助机器人等。通过提供自主的康复解决方案,能够显著提高患者的康复效率和体验,降低对医疗资源的依赖,具有广泛的社会价值和实际影响。
📄 摘要(原文)
Autonomous rehabilitation systems must not only recognize human motion but also provide structured feedback to support users without continuous therapist supervision. This paper presents a telerehabilitation pipeline that integrates skeleton-based exercise quality assessment and short-term motion prediction into a two-module system operating on marker-free RGB video. A self-attentive Bidirectional LSTM performs exercise quality classification using MMD-NCA metric learning, while a graph-based motion prediction module computes per-joint position errors between predicted and observed poses, generating spatially localized deviation signals. Each module is evaluated independently on established benchmarks: the classifier achieves 96.45% mean-class accuracy on squat sequences from the PROZIS dataset, and the adopted STARS predictor achieves a mean MPJPE of 75.8 mm at 560 ms on Human3.6M, outperforming graph and recurrent baselines across all prediction horizons. The framework is designed for eventual deployment in assistive robotics and home-based rehabilitation contexts; end-to-end integration and clinical validation are important directions for future work. By combining motion recognition and prediction in a single system, this work contributes a step toward autonomous, feedback-driven telerehabilitation, for more accessible and scalable rehabilitation solutions.