Ego2Robot: Scalable Robot Data Synthesis from Egocentric Human Data

📄 arXiv: 2608.02580v1 📥 PDF

作者: Ye Wang, Pei Lin, Xiong-Hui Chen, Haoqi Yuan, Zhixuan Liang, Yiyang Huang, Anzhe Chen, Zixing Lei, Jie Zhang, Tao Zhang, Haoyang Li, Tong Zhang, Chenxi Xiao, Ziyuan Jiao, Qin Jin

分类: cs.RO

发布日期: 2026-08-03

🔗 代码/项目: PROJECT_PAGE


💡 一句话要点

提出Ego2Robot以解决机器人数据合成问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱六:视频提取与匹配 (Video Extraction) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 机器人操作 数据合成 自我中心视频 动作重定向 视觉合成 多样性筛选 泛化能力 智能机器人

📋 核心要点

  1. 现有方法在机器人操作策略学习中缺乏大规模和多样化的示范数据,限制了模型的泛化能力。
  2. Ego2Robot通过将自我中心的人类操作视频转化为机器人训练数据,提供了一种新的数据合成方式,支持多种机器人形态。
  3. 实验结果表明,联合预训练能够在多个扰动类型下显著提高模型的泛化能力,验证了该方法的有效性。

📝 摘要(中文)

学习通用的机器人操作策略需要大规模和多样化的示范数据。以自我为中心的人类操作视频提供了丰富的场景和任务多样性,然而,如何将这些视频有效转化为机器人训练数据以实现大规模预训练尚未被探索。本文提出了Ego2Robot,一个可扩展的管道,通过动作重定向、机器人视觉合成和多层次质量筛选,将自我中心的人类操作视频转换为机器人训练数据。Ego2Robot支持经过策划的数据集和野外视频,生成了18561小时的机器人训练数据,涵盖15种机器人形态,成为迄今为止最大的自我到机器人数据集。实验表明,在Ego2Robot合成数据和机器人数据上进行联合预训练,能够显著提高多种扰动类型下的分布外泛化能力,并在真实机器人部署中得到了验证。

🔬 方法详解

问题定义:本文旨在解决如何将自我中心的人类操作视频有效转化为机器人训练数据的问题。现有方法在数据规模和多样性上存在不足,限制了机器人操作策略的学习效果。

核心思路:Ego2Robot的核心思路是通过动作重定向和视觉合成技术,将人类操作视频转化为适合机器人学习的数据格式,从而实现大规模数据合成。

技术框架:Ego2Robot的整体架构包括三个主要模块:动作重定向、机器人臂视觉合成和多层次质量筛选。首先,通过动作重定向将人类的操作动作映射到机器人上;然后,利用视觉合成技术生成机器人操作的视觉数据;最后,对生成的数据进行质量筛选以确保数据的有效性和多样性。

关键创新:Ego2Robot的最大创新在于其可扩展性和对多种机器人形态的支持,使得合成的数据集规模大幅提升,成为最大的自我到机器人数据集。与现有方法相比,Ego2Robot在数据合成的多样性和质量上具有显著优势。

关键设计:在设计过程中,Ego2Robot采用了多层次的质量筛选机制,以确保生成数据的高质量。此外,针对不同机器人形态,设计了特定的动作重定向策略,以提高合成数据的适用性和有效性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,在Ego2Robot合成数据和机器人数据上进行联合预训练,能够在多个扰动类型下提高模型的泛化能力,具体表现为在真实机器人部署中的性能提升,验证了该方法的有效性和实用性。

🎯 应用场景

Ego2Robot的研究成果在机器人操作、自动化制造、智能家居等领域具有广泛的应用潜力。通过提供丰富的训练数据,能够有效提升机器人在复杂环境中的操作能力,推动智能机器人技术的进一步发展。

📄 摘要(原文)

Learning generalizable robot manipulation policies requires large-scale and diverse demonstration data. Egocentric human manipulation videos offer rich scene and task diversity, and prior work has shown that retargeting and rendering such videos into robot-format data can yield effective per-task policies at small scale. However, whether this approach can provide pretraining benefits for vision-language-action models at scale remains unexplored. We present \textbf{Ego2Robot}, a scalable pipeline that converts egocentric human manipulation videos into robot training data through action retargeting, robot-arm visual synthesis, and multi-level quality curation. Ego2Robot supports both curated datasets and in-the-wild videos, producing 18,561 hours of robot training data spanning 15 robot morphologies, making it the largest ego-to-robot dataset to date. To evaluate generalization, we extend RoboTwin2.0 with disentangled perturbation axes covering visual appearance, scene layout, embodiment morphology, and task semantics. Experiments show that joint pretraining on Ego2Robot-synthesized and robot data consistently improves out-of-distribution generalization across multiple perturbation types, with benefits validated on real-robot deployment. Project page: https://www-ye.github.io/ego2robot_blog/