Scaling Bimanual Household Manipulation from 1,500 hours of Demonstrations to On-Policy Corrections

📄 arXiv: 2609.03591v1 📥 PDF

作者: Jiafeng Xu, Qi Li, Yan Shen, Yiyu Ren, Travis Davies, Shaowen He, Ze Wang, Yifan Yang, Ran Cheng, Hao Dong

分类: cs.RO

发布日期: 2026-09-03


💡 一句话要点

提出XR-2模型以解决双手家庭操作中的数据稀缺问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 双手操作 视觉-语言-动作 数据稀缺 机器人学习 家庭任务 多模态学习 模型训练

📋 核心要点

  1. 现有的双手操作学习方法受限于高质量示范数据的稀缺,导致模型的泛化能力不足。
  2. 本研究提出了XR-2模型,通过1500小时的示范数据和高效的数据处理管道,提升了双手操作的学习效率和性能。
  3. 实验结果显示,在不同数据量的情况下,XR-2的任务成功率持续提高,验证了模型的扩展性和数据集的有效性。

📝 摘要(中文)

本研究发布了1500小时的多样化双手操作示范数据,旨在解决高质量大规模人类示范数据稀缺的问题。通过构建高通量数据管道和多阶段训练范式,训练出强大的视觉-语言-动作(VLA)模型XR-2。研究表明,在专家示范数据量和实时人类干预的DAgger修正数据的后训练中,任务成功率随着数据量的增加而稳步提升,验证了XR-2的学习能力和数据集的扩展潜力。该数据集已开源,以支持双手机器人操作学习的可重复研究。

🔬 方法详解

问题定义:本研究旨在解决双手家庭操作中高质量示范数据稀缺的问题。现有方法在数据量不足时,模型的学习能力和泛化能力受到限制。

核心思路:论文提出XR-2模型,利用1500小时的多样化示范数据,通过高通量数据管道和多阶段训练范式,提升双手操作的学习效率和性能。

技术框架:整体架构包括数据收集、预处理、模型训练和后期修正四个主要模块。数据收集阶段使用高通量管道获取示范数据,预处理阶段确保数据的多样性和质量,模型训练采用多阶段策略,最后通过DAgger方法进行实时干预修正。

关键创新:最重要的技术创新在于构建了一个高效的数据处理管道和多阶段训练范式,使得XR-2在数据利用率和训练效率上优于现有方法。

关键设计:在模型设计中,采用了特定的损失函数以优化双手操作的精度,并通过调整网络结构以适应多模态输入,确保模型能够有效处理视觉、语言和动作信息。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,XR-2模型在不同数据量下的任务成功率持续提升,尤其是在使用DAgger修正数据后,成功率显著提高,验证了模型的学习能力和数据集的有效性。具体数据表明,成功率在数据量增加时呈现出明显的线性增长趋势。

🎯 应用场景

该研究的潜在应用领域包括家庭服务机器人、智能家居系统以及人机协作等。通过提升双手操作的学习能力,XR-2模型能够在实际场景中更好地执行复杂的家庭任务,具有重要的实际价值和广泛的市场前景。

📄 摘要(原文)

Learning generalist policies for robust bimanual manipulation is bottlenecked by the scarcity of high quality large scale human demonstration data. In this work, we release 1,500 hours of diverse bimanual manipulation demonstrations covering everyday household tasks, and use this comprehensive corpus to train XR-2, a powerful vision-language-action (VLA) model. Enabled by a purpose built high throughput data pipeline and a carefully designed multi stage training paradigm, XR-2 attains strong manipulation performance in our systematic experiments while retaining favorable training efficiency and high data utilization. We further study two critical scaling axes: varying the amount of expert demonstration data, and post training on DAgger correction data from real time human interventions. In both settings, task success rate improves steadily over the data ranges we probe, exhibiting a clear consistent scaling trend at our current data scale. These results validate both the learning capacity of XR-2 and the promising scaling properties of the released dataset, which we open source to support reproducible research on bimanual robot manipulation learning.