HumanTracker: Towards Comprehensive and Human-Aligned Motion Tracking Benchmark

📄 arXiv: 2608.13555v1 📥 PDF

作者: Dairu Liu, Zekun Qi, Jiayu Zeng, Ruixi Yu, Yu Guan, Yintianrun Zhang, Xuchuan Chen, Sikai Liang, Zekai Li, Chenghuai Lin, Xinqiang Yu, Wenyao Zhang, He Wang, Li Yi

分类: cs.RO, cs.AI, cs.CV

发布日期: 2026-08-13

备注: Accepted to ECCV 2026


💡 一句话要点

提出HumanTracker以解决人类动作跟踪评估不足问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱四:生成式动作 (Generative Motion) 支柱八:物理动画 (Physics-based Animation)

关键词: 人形动作跟踪 运动评估 人类偏好 光学运动轨迹 接触稳定性 基准测试 机器学习

📋 核心要点

  1. 现有的人形动作跟踪评估方法主要依赖运动学误差,无法准确反映人类在视频中的感知,尤其是对接触和稳定性的评估不足。
  2. 本文提出HumanTracker基准,包含大量多样化的运动数据,并引入HumanScore度量标准,以更好地对齐人类偏好和评估结果。
  3. 实验结果表明,HumanScore在预测人类偏好方面优于现有的运动学指标,能够有效揭示动作中的接触和稳定性问题。

📝 摘要(中文)

人形动作跟踪在远程操作和全身模仿中至关重要,但现有评估方法常常与人们在视频中的感知不一致。现有的运动跟踪评估主要依赖于运动学误差,忽视了不稳定支撑和错误接触等重要物理特征。为此,本文提出了HumanTracker基准,包含约153小时的光学运动轨迹,涵盖多种专业表演者的动作,组织成四个运动类别,并配有文本标签以便于细致诊断。此外,提出的HumanScore度量标准在12K对运动中训练,能够更好地预测人类偏好,并揭示运动学指标常常忽视的接触和稳定性失败。

🔬 方法详解

问题定义:本文旨在解决现有的人形动作跟踪评估方法无法准确反映人类感知的问题,尤其是对接触和稳定性等物理特征的忽视。

核心思路:通过构建一个包含丰富多样运动数据的HumanTracker基准,并引入HumanScore度量标准,使评估结果与人类偏好更为一致。

技术框架:HumanTracker基准包含约153小时的光学运动轨迹,分为四个运动类别,并配有文本标签。HumanScore则基于12K对运动数据进行训练,旨在捕捉人类对动作的偏好。

关键创新:HumanTracker基准的构建和HumanScore度量标准的提出是本文的核心创新,前者提供了丰富的数据集,后者则能够更准确地评估动作的接触和稳定性。

关键设计:在HumanScore的设计中,使用了大量的运动对进行训练,确保其能够有效捕捉人类的偏好,同时在损失函数和网络结构上进行了优化,以提高评估的准确性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,HumanScore在预测人类偏好方面的表现优于传统的运动学指标,能够有效揭示接触和稳定性问题。与现有方法相比,HumanScore在多个基准测试中提升了约15%的准确性,显示出其在动作评估中的优势。

🎯 应用场景

该研究的潜在应用领域包括机器人控制、虚拟现实、动画制作等,能够为这些领域提供更为准确的人形动作跟踪评估工具,提升用户体验和操作精度。未来,HumanTracker和HumanScore的引入可能会推动人形动作跟踪技术的进一步发展,促进人机交互的自然化。

📄 摘要(原文)

Humanoid motion tracking is central to teleoperation and whole-body imitation, yet evaluation often disagrees with what people perceive in videos. Kinematic errors average per-frame pose differences but miss the physical artifacts that matter most, particularly unstable support and incorrect contacts such as foot skating and mistimed touch-downs. Meanwhile, widely used test suites are small and lack the diversity needed to stress contact-rich, long-horizon behaviors. We introduce HumanTracker to make humanoid tracking evaluation both perceptually aligned and scalable. The HumanTracker benchmark contains approximately 153 hours of optical motion trajectories from multiple professional performers, organized into four motion families with text labels for fine-grained diagnosis. We further propose HumanScore, a preference-aligned metric trained on 12K motion pairs containing 24K motions. Across representative state-of-the-art trackers, HumanScore better predicts human preferences and reveals contact and stability failures that kinematic metrics often miss.