RoboEdit: Turning Human Manipulation Videos into Scalable Robot Experience

📄 arXiv: 2608.18948v1 📥 PDF

作者: Yaowei Guo, Zeng Tao, Yuxin Jiang, Yunuo Chen, Zhiyang Dou, Yuxiang Ma, Yin Yang, Demetri Terzopoulos, Ying Jiang, Chenfanfu Jiang

分类: cs.RO

发布日期: 2026-08-19

备注: 14 pages, 13 figures. Supplementary material included


💡 一句话要点

提出RoboEdit以解决机器人训练数据稀缺问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱四:生成式动作 (Generative Motion) 支柱七:动作重定向 (Motion Retargeting)

关键词: 机器人学习 视频编辑 3D交互 自动化管道 跨形态适应 高保真监督

📋 核心要点

  1. 现有方法在机器人手-物体交互数据收集上成本高且依赖具体的机器人形态,导致数据稀缺。
  2. RoboEdit通过将人类操作视频转化为机器人可用的视频,利用自动化管道实现3D交互的重建和重新定向。
  3. 实验结果显示,RoboEdit在编辑质量上达到最先进水平,并有效支持实际操作任务中的机器人控制策略。

📝 摘要(中文)

收集机器人手-物体交互数据成本高且依赖具体形态,而大量人类物体操作视频未能用于机器人训练。我们提出RoboEdit,一个人类到机器人视频编辑套件,将人类操作视频转化为动作一致、物理合理的机器人视频,并对齐3D手部状态。为实现可扩展的监督,我们引入RoboEdit-ADC,一个自动化管道,从RGB视频中重建和重新定向3D交互,生成包含174K对齐视频对(14M帧)的RoboEdit-14M大规模数据集。核心编辑引擎RoboEdit-Trans采用跨形态适应模块,在适应外观和运动的同时保持时间一致性,并集成3D机器人状态解码器以恢复每帧手部状态。实验表明,RoboEdit实现了最先进的编辑质量,并支持实际操作任务中的下游机器人控制策略。最终,RoboEdit套件释放了未标记人类视频的巨大潜力,为可扩展、高保真视觉和3D运动监督提供了基础,促进了可泛化的机器人学习。

🔬 方法详解

问题定义:本论文旨在解决机器人训练中手-物体交互数据稀缺的问题。现有方法在收集数据时成本高且依赖具体的机器人形态,限制了数据的可用性和多样性。

核心思路:RoboEdit的核心思路是将人类的操作视频转化为适用于机器人训练的高质量视频,通过自动化管道实现3D交互的重建与重新定向,从而降低数据收集的成本和复杂性。

技术框架:RoboEdit的整体架构包括三个主要模块:RoboEdit-ADC用于自动化数据处理,RoboEdit-Trans用于视频编辑和适应,3D Robot-State Decoder用于恢复手部状态。该框架支持从RGB视频生成对齐的机器人视频。

关键创新:RoboEdit的主要创新在于跨形态适应模块的引入,使得在不同机器人形态之间保持时间一致性,同时适应外观和运动。这一设计使得生成的视频在物理上更合理且动作一致。

关键设计:在技术细节上,RoboEdit采用了特定的损失函数来优化视频的质量和一致性,并设计了适应性强的网络结构,以支持不同形态的机器人在视频中的表现。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,RoboEdit在视频编辑质量上达到了最先进的水平,支持下游机器人控制策略在实际操作任务中的应用。具体而言,RoboEdit在编辑质量上相比于基线方法提升了显著的性能,展示了其在实际操作中的有效性。

🎯 应用场景

RoboEdit的研究成果在多个领域具有潜在应用价值,包括机器人学习、自动化制造、虚拟现实和增强现实等。通过将未标记的人类操作视频转化为机器人可用的数据,RoboEdit可以显著降低机器人训练的成本,提高训练效率,推动智能机器人在复杂环境中的应用。

📄 摘要(原文)

Collecting robot hand-object interaction data is costly and embodiment-specific, yet abundant human-object videos remain unusable for robot training. We present RoboEdit, a human-to-robot video editing suite that transforms human manipulation videos into action-consistent, physically plausible robot videos with aligned 3D hand states. To enable scalable supervision, we introduce RoboEdit-ADC, an automatic pipeline that reconstructs and retargets 3D interactions from RGB videos across embodiments. This pipeline generates RoboEdit-14M, a large-scale dataset of 174K aligned video pairs (14M frames) spanning seven robot embodiments, diverse scenes, and interaction types. The core editing engine, RoboEdit-Trans, employs cross-embodiment adaptation modules to preserve temporal coherence while adapting appearance and motion. It further integrates a 3D Robot-State Decoder to recover per-frame hand states for structured motion supervision. Experiments show that RoboEdit achieves state-of-the-art editing quality and supports downstream robot control policies in real-world manipulation tasks. Ultimately, the RoboEdit suite unlocks the vast potential of unlabeled human videos, providing scalable, high-fidelity visual and 3D motion supervision for generalizable robot learning.